
GPT-6 Astra hat 7 von 100 Aufgaben im Benchmark StationeryBench mit Robotern, die zwei Arme verwenden, erledigt. Die konkurrierende Modell MolmoAct2 hat keine einzige Aufgabe beendet, heißt es im The Decoder.
Die Ausgabe überträgt die Einschätzung des Forschers, der das Ergebnis als einen „Sprung“ im räumlichen Denken bezeichnete. Allerdings liegen die verfügbaren Daten nur als kurzes Quellenbeschreibung vor, ohne Details zur Methodik und zu den Testbedingungen.
Der praktische Wert des Ergebnisses ist bisher auf den Rahmen eines frühen Vergleichs beschränkt. Zur Bewertung der Stabilität eines möglichen Vorteils werden Informationen zu weiteren Aufgabensets, Replikationen des Experiments und dem Verhalten der Modelle in realen robotischen Szenarien benötigt.
redaktioneller Kommentar
Warum es wichtig ist
Wahrscheinliche Folge ist ein erhöhtes Interesse daran, die räumlichen Fähigkeiten von Modellen zur Steuerung von Robotern zu überprüfen. Als nächstes beobachtbares Signal werden vollständige methodische Daten, wiederholte Tests und Ergebnisse zu anderen Aufgaben erscheinen. Große Unsicherheit ergibt sich daraus, dass die verfügbare Beschreibung auf Metadaten einer einzigen Quelle beschränkt ist.