A MLCommons anunciou o lançamento do MLPerf Training v6.1, que inclui a primeira avaliação de pós-treinamento para grandes modelos de linguagem. A iniciativa incorpora uma tarefa de aprendizado por reforço baseado em agentes: o sistema deve treinar um modelo de linguagem com 397 bilhões de parâmetros para corrigir projetos de software reais.

O teste mede a velocidade com que tal sistema domina essa tarefa. Com isso, o MLPerf expande a avaliação de desempenho para além do treinamento convencional de modelos, abrangendo também seu ajuste subsequente para trabalho com código de programação.

O significado prático da iniciativa dependerá de como exatamente as tarefas, os critérios de correção e a comparação de resultados são organizados. Como esses detalhes não estão presentes nos materiais disponíveis, a publicação descreve até o momento apenas o próprio benchmark, e não os resultados dos participantes.