
MLCommons gab die Veröffentlichung von MLPerf Training v6.1 mit dem ersten Benchmark für das Nachtraining großer Sprachmodelle bekannt. Darin enthalten ist eine Aufgabe zum agentenbasierten bestärkenden Lernen: Das System muss ein Sprachmodell mit 397 Milliarden Parametern so trainieren, dass es reale Softwareprojekte korrigieren kann.
Der Test misst die Geschwindigkeit, mit der ein solches System diese Aufgabe erlernt. Damit erweitert MLPerf die Leistungsbewertung über das übliche Modelltraining hinaus auf die anschließende Feinabstimmung für die Arbeit mit Programmcode.
Der praktische Wert der Initiative hängt davon ab, wie genau die Aufgaben gestellt sind, welche Kriterien für erfolgreiche Korrekturen gelten und wie die Ergebnisse verglichen werden. In den verfügbaren Materialien fehlen diese Details; daher beschreibt die Veröffentlichung derzeit nur den Benchmark selbst, nicht aber die Ergebnisse der Teilnehmer.
redaktioneller Kommentar
Warum es wichtig ist
Der wahrscheinliche Wert des Tests liegt in der Einführung einer allgemeinen Methode zum Vergleich von Systemen, die große Modelle für die praktische Softwareentwicklung nachtrainieren. Das nächste beobachtbare Signal werden die veröffentlichte Methodik und die Ergebnisse der Teilnehmer sein. Eine erhebliche Unsicherheit besteht darin, dass nur eine Zusammenfassung der Quelle ohne Testdetails verfügbar ist.