Apple Machine Learning Researchは「Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning」という研究を発表した。そこでは、マルチモーダル大規模言語モデルが空間的・時間的および動作に関連する環境について推論する方法を検討している。

本研究の中心は、モデルが学習時にビジュアル思考を学習し、出力時には直接推論できるかどうかという点である。これに対してVisual CoTは、推論のために中間のビジュアルを作成する。

著者らは、中間的な画像を使用することが、特にプロアクティブな動画分析において推論コストを大幅に増加させると結びつけている。出典は実験結果、具体的なアーキテクチャ、性能指標については報告していない。