Apple Machine Learning Research сообщила о крупном эмпирическом исследовании Group Relative Policy Optimization (GRPO) в неанглоязычных и многоязычных сценариях. Работа охватывает разные базовые модели, языки обучения и варианты вознаграждений за язык рассуждения.

По данным синопсиса исследования, обучение рассуждению на родном языке часто оставляет лишь небольшой разрыв по сравнению с обучением рассуждению на английском. Авторы связывают работу с подходом обучения с подкреплением на проверяемых вознаграждениях (RLVR), который часто оптимизируют с помощью GRPO.

Практическое значение вывода пока ограничено доступным описанием: источник не приводит в предоставленном материале размеры разрыва, перечень языков, модели или условия экспериментов. Поэтому утверждение требует проверки по полному тексту исследования и независимым работам.