
MLCommons anunció el lanzamiento de MLPerf Training v6.1, que incluye la primera evaluación de post-entrenamiento para grandes modelos de lenguaje. Se ha incorporado una tarea de aprendizaje por refuerzo basado en agentes: el sistema debe entrenar un modelo de lenguaje con 397 mil millones de parámetros para corregir proyectos de software reales.
La prueba mide la velocidad con la que dicho sistema domina esta tarea. De este modo, MLPerf amplía la evaluación del rendimiento más allá del entrenamiento habitual del modelo, extendiéndolo a su ajuste posterior para trabajar con código de software.
La relevancia práctica de esta iniciativa dependerá de cómo se organicen exactamente las tareas, los criterios de corrección y la comparación de resultados. Estos detalles no están disponibles en los materiales actuales, por lo que la publicación describe hasta ahora el propio benchmark, no los resultados de los participantes.
comentario editorial
Por qué importa
El valor probable de la prueba radica en la aparición de un método general para comparar sistemas que realizan post-entrenamiento de grandes modelos para el desarrollo práctico de software. La señal observable más cercana serán la metodología y los resultados publicados por los participantes. Una incertidumbre significativa persiste, ya que solo está disponible el sinopsis de la fuente sin detalles sobre las pruebas.