La division Apple Machine Learning Research a présenté un nouvel ensemble de données nommé LVSum, destiné à évaluer la capacité des grands modèles linguistiques multimodaux (MLLM) à générer des résumés de vidéos longues. La principale difficulté que ce projet vise à résoudre réside dans le maintien de la fidélité temporelle lors du traitement de contenus étendus, où les modèles perdent souvent le lien entre le contenu sémantique et les moments spécifiques.

Le référentiel comprend 72 vidéos hétérogènes couvrant 13 domaines sujets différents. La durée moyenne de chaque vidéo est de 16inutes. Une caractéristique unique de cet ensemble de données est la présence jusqu'à 10 annotations-résumés humains pour chaque clip, contenant des références temporelles précises, ce qui permet une évaluation détaillée de l'alignement entre le texte et la séquence vidéo.

L'introduction de LVSum établit une base standardisée pour tester des algorithmes qui nécessitent non seulement une compréhension générale de l'intrigue, mais aussi une indication précise des intervalles de temps des événements. Cela diffère des approches précédentes, où l'accent était souvent mis exclusivement sur la justesse sémantique sans vérification stricte de la séquence chronologique.