Apple Machine Learning Research describe la evaluación de la calidad de los subtítulos de video mediante respuestas a preguntas de opción múltiple. El enfoque se presenta en el trabajo «Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering».

Según el sinopsis del editor, las métricas existentes comparan el texto generado con descripciones de referencia. Apple señala que este principio no tiene en cuenta bien los casos en que un mismo video puede permitir varias descripciones correctas, y generalmente sólo ofrece una evaluación unidimensional de la calidad.