A Apple Machine Learning Research descreve a avaliação da qualidade de legendas de vídeo usando respostas de múltipla escolha. A abordagem é apresentada no artigo 'Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering'.

Segundo a sinopse do editor, métricas comuns comparam o texto gerado com descrições de referência. A Apple observa que esse princípio não considera bem os casos em que um vídeo pode ter várias descrições corretas e geralmente produz apenas uma pontuação de qualidade unidimensional.