Hugging Face Blog は、より質の高い構造化された応答の生成に向けて350 万パラメータのモデルをファインチューニングしたとする記事を公表しました。見出しには、GRPO ステップが 100 回であることも明記されています。

利用可能なパッケージには、メタデータと、オープンソースおよびオープンサイエンスを通じて人工知能の開発と民主化を図るという Hugging Face のミッションの簡潔な説明のみが含まれています。結果、使用されたデータセット、ベースラインモデルとの比較に関するデータは欠落しています。