Apple Machine Learning Research beschreibt die Bewertung der Qualität von Videounterschriften mithilfe von Antworten auf Multiple-Choice-Fragen. Der Ansatz wird in der Arbeit „Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering“ vorgestellt.

Nach dem Synopis des Verlags legen gängige Metriken nahe, dass der generierte Text mit Referenzbeschreibungen verglichen wird. Apple weist darauf hin, dass ein solcher Ansatz schlecht berücksichtigt, dass ein Video mehrere korrekte Beschreibungen zulässt, und in der Regel eine eindimensionale Qualitätsbewertung liefert.