MLCommons gab die Veröffentlichung von MLPerf Training v6.1 mit dem ersten Benchmark für das Nachtraining großer Sprachmodelle bekannt. Darin enthalten ist eine Aufgabe zum agentenbasierten bestärkenden Lernen: Das System muss ein Sprachmodell mit 397 Milliarden Parametern so trainieren, dass es reale Softwareprojekte korrigieren kann.

Der Test misst die Geschwindigkeit, mit der ein solches System diese Aufgabe erlernt. Damit erweitert MLPerf die Leistungsbewertung über das übliche Modelltraining hinaus auf die anschließende Feinabstimmung für die Arbeit mit Programmcode.

Der praktische Wert der Initiative hängt davon ab, wie genau die Aufgaben gestellt sind, welche Kriterien für erfolgreiche Korrekturen gelten und wie die Ergebnisse verglichen werden. In den verfügbaren Materialien fehlen diese Details; daher beschreibt die Veröffentlichung derzeit nur den Benchmark selbst, nicht aber die Ergebnisse der Teilnehmer.