A Apple Machine Learning Research relatou um grande estudo empírico sobre Group Relative Policy Optimization (GRPO) em cenários não anglófonos e multilíngues. O trabalho abrange diferentes modelos base, idiomas de treinamento e variações de recompensa para o idioma de raciocínio.

De acordo com o sinopse do estudo, o treinamento de raciocínio na língua nativa frequentemente deixa apenas uma pequena lacuna em comparação com o treinamento de raciocínio em inglês. Os autores associam o trabalho à abordagem de Aprendizado por Reforço com Recompensas Verificáveis (RLVR), que é frequentemente otimizada usando GRPO.

O significado prático da descoberta é atualmente limitado pela descrição disponível: a fonte não fornece, no material apresentado, as dimensões da lacuna, a lista de idiomas, os modelos ou as condições dos experimentos. Portanto, a afirmação requer verificação através do texto completo da pesquisa e de trabalhos independentes.