
MLCommons a annoncé la publication de MLPerf Training v6.1, qui inclut le premier test de post-entraînement pour les grands modèles de langage. Celui-ci intègre une tâche d'apprentissage par renforcement agentiel: le système doit entraîner un modèle de langage doté de 397 milliards de paramètres à corriger de véritables projets logiciels.
Le test mesure la vitesse à laquelle un tel système maîtrise cette tâche. Ainsi, MLPerf étend l'évaluation des performances au-delà de l'entraînement classique des modèles, pour inclure leur ajustement ultérieur en vue du travail sur le code informatique.
La portée pratique de cette initiative dépendra de la manière exacte dont sont organisées les tâches, les critères de correction et la comparaison des résultats. Ces détails ne figurent pas dans les documents disponibles; par conséquent, la publication décrit pour l'instant le benchmark lui-même, et non les résultats des participants.
commentaire éditorial
Pourquoi c’est important
La valeur probable de ce test réside dans l'émergence d'une méthode générale pour comparer les systèmes qui effectuent un post-entraînement de grands modèles en vue du développement logiciel pratique. Le signal observable le plus proche sera la publication de la méthodologie et des résultats des participants. Une incertitude substantielle subsiste, car seul le synopsis de la source est accessible, sans les détails des tests.