Apple Machine Learning Researchは、複数の選択肢を伴う質問の回答を通じて動画キャプションの品質を評価する方法を説明しています。出典は「Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering」という論文です。

シノプシスの記述によると、既存のメトリクスは生成されたテキストを標準的な記述と照合することに主眼が置かれており、同じ動画に対して複数の正しい記述があり得るケースを十分に考慮していないこと、そして通常は一元的な品質評価しか提供していないことが指摘されている。