
GPT-6 Astra completó 7 de 100 tareas en el benchmark StationeryBench con robots de dos manos. La modelo competitiva MolmoAct2 no terminó ninguna tarea, según el material de The Decoder.
La publicación transmite la valoración de un investigador que describió el resultado como un “salto” en el razonamiento espacial. Sin embargo, los datos disponibles se presentan solo como una descripción breve de la fuente, sin detalles sobre la metodología ni las condiciones de la prueba.
El significado práctico del resultado, por ahora, está limitado a un único y temprano conjunto de comparaciones. Para evaluar la robustez de la ventaja, se requieren informaciones sobre otros conjuntos de tareas, repeticiones del experimento y el rendimiento de modelos en escenarios robóticos reales.
comentario editorial
Por qué importa
Probable consecuencia — mayor interés en verificar habilidades espaciales de modelos para manejar robots. El siguiente indicio observable serán los datos metodológicos completos, pruebas repetidas y resultados en otras tareas. Una incertidumbre sustancial está relacionada con que la descripción disponible está limitada a metadatos de una sola fuente.