Apple Machine Learning Research a annoncé une vaste étude expérimentale sur le Group Relative Policy Optimization (GRPO) dans des scénarios non anglophones et multilingues. Le travail couvre différentes modèles fondamentaux, langues d’apprentissage et variantes de récompenses pour le raisonnement linguistique.

Selon le synopsis de l’étude, l’entraînement au raisonnement dans la langue maternelle laisse souvent une faible différence par rapport à l’entraînement au raisonnement en anglais. Les auteurs associent ce travail à l’approche d’apprentissage par renforcement sur des récompenses vérifiables (RLVR), qui est souvent optimisée à l’aide du GRPO.

L’interprétation pratique de cette conclusion est actuellement limitée par la description disponible: la source ne fournit pas dans le matériel disponible les ordres de grandeur de l’écart, la liste des langues, les modèles ou les conditions expérimentales. Par conséquent, l’énoncé nécessite une vérification à partir du texte complet de l’étude et des travaux indépendants.