GPT-6 Astra は StationeryBench の7 件の課題を100 件達成したのに対し、MolmoAct2 はこの比較で一つも課題を完了していない。The Decoder の記事によると。

研究者は結果を“跳躍”と評価したが、入手可能なデータはメタデータのみの簡潔な説明として提供され、手法と条件の詳細はない。

結果の実用的な意味は、現段階では限定的である。優位性を評価するには、他の課題セットでのデータ、実験の再現性、実ロボットシナリオでの挙動が必要である。