GPT-6 Astra a accompli 7 sur 100 tâches dans le benchmark StationeryBench impliquant des robots à deux bras. Le concurrent MolmoAct2 n'a terminé aucune tâche, selon le matériel de The Decoder.

L'édition rapporte l'évaluation d'un chercheur ayant qualifié le résultat de « saut » dans le raisonnement spatial. Cependant, les données disponibles sont présentées uniquement sous forme de description concise de la source, sans détails sur la méthodologie et les conditions du test.

La signification pratique du résultat est encore limitée au cadre d'une seule comparaison précoce. Pour évaluer la robustesse de l'avantage, il faut des informations sur d'autres ensembles de tâches, la répétabilité de l'expérience et le comportement des modèles dans des scénarios robotiques réels.