MLCommons сообщила о выпуске MLPerf Training v6.1 с первой проверкой постобучения больших языковых моделей. В неё включена задача агентного обучения с подкреплением: система должна обучить языковую модель с 397 млрд параметров исправлять реальные программные проекты.

Тест измеряет скорость, с которой такая система осваивает эту задачу. Тем самым MLPerf расширяет оценку производительности за пределы обычного обучения модели — к её последующей настройке для работы с программным кодом.

Практическое значение инициативы будет зависеть от того, как именно организованы задания, критерии исправления и сравнение результатов. В доступных материалах этих подробностей нет, поэтому публикация пока описывает сам бенчмарк, а не результаты участников.