
Apple Machine Learning Research décrit l’évaluation de la qualité des sous-titres vidéo à l’aide de réponses à des questions à choix multiples. L’approche est présentée dans l’article « Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering ».
Selon le synopsis de l’éditeur, les métriques existantes comparent le texte généré à des descriptions de référence. Apple indique que ce principe ne prend pas bien en compte les cas où une même vidéo peut avoir plusieurs descriptions correctes et donne généralement une évaluation de qualité unidimensionnelle.
commentaire éditorial
Pourquoi c’est important
Conséquence probable — un attention accrue à l’évaluation des sous-titres vidéo par la vérification du contenu, et non seulement par la correspondance des mots. Le prochain signal observé sera la publication des détails de la méthodologie, des expériences et des comparaisons avec les métriques existantes. Une incertitude substantielle demeure: seule une synthèse est fournie, sans résultats ni description complète de l’approche.