Apple Machine Learning Research berichtete über eine große empirische Studie zur Group Relative Policy Optimization (GRPO) in nicht-englischsprachigen und mehrsprachigen Szenarien. Die Arbeit umfasst verschiedene Basismodelle, Trainingssprachen und Varianten von Belohnungen für die Sprache der Schlussfolgerung.

Laut der Zusammenfassung der Studie lässt das Training von Schlussfolgerungen in der Muttersprache im Vergleich zum Training auf Englisch oft nur eine kleine Lücke. Die Autoren verbinden die Arbeit mit dem Ansatz des verstärkenden Lernens basierend auf überprüfbaren Belohnungen (RLVR), der häufig mittels GRPO optimiert wird.

Die praktische Bedeutung der Erkenntnis ist derzeit durch die verfügbare Beschreibung begrenzt: Die Quelle nennt im vorliegenden Material weder die Größe der Lücke, eine Liste der Sprachen, die Modelle noch die experimentellen Bedingungen. Daher erfordert die Aussage eine Überprüfung anhand des vollständigen Forschungstextes und unabhängiger Arbeiten.