Apple Machine Learning Research décrit l’évaluation de la qualité des sous-titres vidéo à l’aide de réponses à des questions à choix multiples. L’approche est présentée dans l’article « Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering ».

Selon le synopsis de l’éditeur, les métriques existantes comparent le texte généré à des descriptions de référence. Apple indique que ce principe ne prend pas bien en compte les cas où une même vidéo peut avoir plusieurs descriptions correctes et donne généralement une évaluation de qualité unidimensionnelle.