
Apple Machine Learning Research beschreibt die Bewertung der Qualität von Videounterschriften mithilfe von Antworten auf Multiple-Choice-Fragen. Der Ansatz wird in der Arbeit „Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering“ vorgestellt.
Nach dem Synopis des Verlags legen gängige Metriken nahe, dass der generierte Text mit Referenzbeschreibungen verglichen wird. Apple weist darauf hin, dass ein solcher Ansatz schlecht berücksichtigt, dass ein Video mehrere korrekte Beschreibungen zulässt, und in der Regel eine eindimensionale Qualitätsbewertung liefert.
redaktioneller Kommentar
Warum es wichtig ist
Wahrscheinliche Folge ist weitere Aufmerksamkeit zur Bewertung von Videobeschreibungen durch Inhaltsprüfungen und nicht nur durch Wortübereinstimmung. Als nächstes beobachtetes Signal wird die Veröffentlichung von Details zur Methodik, zu Experimenten und zu Vergleichen mit bestehenden Metriken sein. Wesentliche Unsicherheit bleibt bestehen: Es wird nur eine Zusammenfassung bereitgestellt, ohne Ergebnisse und vollständige Beschreibung des Ansatzes.