GPT-6 Astra выполнила 7 из 100 заданий в бенчмарке StationeryBench с роботами, использующими две руки. Конкурирующая модель MolmoAct2 не завершила ни одного задания, говорится в материале The Decoder.

Издание передаёт оценку исследователя, назвавшего результат «скачком» в пространственном рассуждении. Однако доступные данные представлены только в виде краткого описания источника, без подробностей о методике и условиях теста.

Практическое значение результата пока ограничено рамками одного раннего сравнения. Для оценки устойчивости преимущества нужны сведения о других наборах заданий, повторяемости эксперимента и поведении моделей в реальных роботизированных сценариях.