GPT-6 Astra cumpriu 7 de 100 tarefas no benchmark StationeryBench com robôs de duas mãos. A concorrente MolmoAct2 não concluiu nenhuma tarefa, conforme o material da The Decoder.

A publicação repassa a avaliação de um pesquisador que descreveu o resultado como um “salto” no raciocínio espacial. Contudo, os dados disponíveis aparecem apenas como uma descrição breve da fonte, sem detalhes sobre a metodologia e as condições do teste.

O valor prático do resultado permanece limitado a este único comparativo inicial. Para avaliar a robustez da vantagem, são necessários dados de outros conjuntos de tarefas, repetição de experimentos e desempenho dos modelos em cenários robóticos reais.