
GPT-6 Astra は StationeryBench の7 件の課題を100 件達成したのに対し、MolmoAct2 はこの比較で一つも課題を完了していない。The Decoder の記事によると。
研究者は結果を“跳躍”と評価したが、入手可能なデータはメタデータのみの簡潔な説明として提供され、手法と条件の詳細はない。
結果の実用的な意味は、現段階では限定的である。優位性を評価するには、他の課題セットでのデータ、実験の再現性、実ロボットシナリオでの挙動が必要である。
編集部コメント
なぜ重要か
推定される結果は、モデルの空間的能力を検証するためのロボット制御に対する関心の高まり。次に観測されるシグナルは、方法論データの完全公開、再テスト、および他のタスクでの結果となる。重大な不確実性は、利用可能な説明が単一の情報源のメタデータに限定されている点にある。