
GPT-6 Astra cumpriu 7 de 100 tarefas no benchmark StationeryBench com robôs de duas mãos. A concorrente MolmoAct2 não concluiu nenhuma tarefa, conforme o material da The Decoder.
A publicação repassa a avaliação de um pesquisador que descreveu o resultado como um “salto” no raciocínio espacial. Contudo, os dados disponíveis aparecem apenas como uma descrição breve da fonte, sem detalhes sobre a metodologia e as condições do teste.
O valor prático do resultado permanece limitado a este único comparativo inicial. Para avaliar a robustez da vantagem, são necessários dados de outros conjuntos de tarefas, repetição de experimentos e desempenho dos modelos em cenários robóticos reais.
comentário editorial
Por que importa
Consequência provável — maior interesse em verificar as habilidades espaciais de modelos para controlar robôs. O próximo sinal observado serão os dados metodológicos completos, testes repetidos e resultados em outras tarefas. Uma incerteza substancial está relacionada ao fato de que a descrição disponível está limitada aos metadados de uma única fonte.