Apple Machine Learning Research部門の専門家らは、現代の言語・視覚モデル(VLM)がテキスト情報のみに依存せず、視覚情報だけに基づいて推論する能力に限りがあることを示す論文を発表した。複雑なテキスト指示に従うことはできても、現在のシステムは画像のセットから一般的な概念を正しく抽出し、それを新しい入力データに適用することができない。

この問題に対応するため、研究者らは「Visual Concept Inference from Sets(VICIS)」という新しい評価タスクを発表した。この手法の本質は、共通のアイデアで結び付けられた少数のコンテキスト画像セットとターゲットクエリをモデルに提供することにある。システムには、コンテキストセットによって定義された概念を保持しつつ、かつクエリとも整合性のある新しい画像を生成することが求められる。

このイニシアチブは、AI 評価におけるギャップを埋め、焦点をテキスト理解から純粋な視覚的論理的思考へとシフトさせることを目指している。VICIS タスクの導入により、テキストの手掛かりに頼らない抽象的な視覚的汎化におけるモデルの進捗を、より正確に測定できるようになる。