これは、同時に画像を処理し、テキストの回答を生成するマルチモーダルの大規模言語モデル(MLLM)についての話です。提供された説明によれば、こうしたシステムに対する好ましい整合性の影響は、通常の言語モデルよりも弱く調べられているとされます。

説明によると、マルチモーダルモデルは画像を理解する際に幻覚に直面します。こうした誤りは、事実に反するだけでなく、画像の内容と一致しない回答として現れることがあります。

著者らは、整合性の主な目的の一つとして、モデルの回答を画像に含まれる情報により密接に結びつけることを挙げています。出典はメタデータの要約として提示されているため、提供された資料には方法論、実験、および結果の詳細は含まれていません。