MLCommons anunció el lanzamiento de MLPerf Training v6.1, que incluye la primera evaluación de post-entrenamiento para grandes modelos de lenguaje. Se ha incorporado una tarea de aprendizaje por refuerzo basado en agentes: el sistema debe entrenar un modelo de lenguaje con 397 mil millones de parámetros para corregir proyectos de software reales.

La prueba mide la velocidad con la que dicho sistema domina esta tarea. De este modo, MLPerf amplía la evaluación del rendimiento más allá del entrenamiento habitual del modelo, extendiéndolo a su ajuste posterior para trabajar con código de software.

La relevancia práctica de esta iniciativa dependerá de cómo se organicen exactamente las tareas, los criterios de corrección y la comparación de resultados. Estos detalles no están disponibles en los materiales actuales, por lo que la publicación describe hasta ahora el propio benchmark, no los resultados de los participantes.