
Apple Machine Learning Researchは「Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning」という研究を発表した。そこでは、マルチモーダル大規模言語モデルが空間的・時間的および動作に関連する環境について推論する方法を検討している。
本研究の中心は、モデルが学習時にビジュアル思考を学習し、出力時には直接推論できるかどうかという点である。これに対してVisual CoTは、推論のために中間のビジュアルを作成する。
著者らは、中間的な画像を使用することが、特にプロアクティブな動画分析において推論コストを大幅に増加させると結びつけている。出典は実験結果、具体的なアーキテクチャ、性能指標については報告していない。
編集部コメント
なぜ重要か
おそらく、空間と時間を考慮する能力を維持しつつ、視覚的推論のコストを削減しようとする試みである。次に検証可能な指標は、本文全体に公開された実験とVisual CoTとの比較となる。依然として重大な不確実性が残っている。