MLCommons a annoncé la publication de MLPerf Training v6.1, qui inclut le premier test de post-entraînement pour les grands modèles de langage. Celui-ci intègre une tâche d'apprentissage par renforcement agentiel: le système doit entraîner un modèle de langage doté de 397 milliards de paramètres à corriger de véritables projets logiciels.

Le test mesure la vitesse à laquelle un tel système maîtrise cette tâche. Ainsi, MLPerf étend l'évaluation des performances au-delà de l'entraînement classique des modèles, pour inclure leur ajustement ultérieur en vue du travail sur le code informatique.

La portée pratique de cette initiative dépendra de la manière exacte dont sont organisées les tâches, les critères de correction et la comparaison des résultats. Ces détails ne figurent pas dans les documents disponibles; par conséquent, la publication décrit pour l'instant le benchmark lui-même, et non les résultats des participants.