Apple Machine Learning Research は、非英語圏および多言語シナリオにおける Group Relative Policy Optimization(GRPO)の大規模な実証研究について報告した。この研究は、異なる基盤モデル、学習言語、および推論言語に対する報酬のバリエーションを網羅している。

研究の概要によると、母国語での推論の学習は、英語での推論の学習と比較して、しばしば小さな格差を残すに留まるという。著者らは、この取り組みを検証可能な報酬に基づく強化学習(RLVR)アプローチに関連付けており、これはしばしば GRPO を用いて最適化される。

現時点での発見の実用的意義は、利用可能な記述によって制限されている。提供された資料には、格差の規模、言語リスト、モデル、または実験条件に関する数値が含まれていない。したがって、この主張については、完全な研究論文および独立した作品による検証が必要である。