Apple Machine Learning Research описывает оценку качества видеоподписей с помощью ответов на вопросы с несколькими вариантами. Подход представлен в работе «Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering».

По данным синопсиса издателя, распространённые метрики сопоставляют сгенерированный текст с эталонными описаниями. Apple указывает, что такой принцип плохо учитывает случаи, когда одно видео допускает несколько корректных описаний, и обычно даёт лишь одномерную оценку качества.