O Hugging Face Blog publicou um material sobre o ajuste fino de um modelo com 350 milhões de parâmetros para uma geração mais qualificada de respostas estruturadas. O título também menciona 100 passos de GRPO.

O pacote disponível contém apenas metadados e uma breve descrição da missão do Hugging Face de desenvolver e democratizar a inteligência artificial por meio de código aberto e ciência aberta. Dados sobre resultados, conjunto de dados e comparação com o modelo base estão ausentes.