Подразделение Apple Machine Learning Research представило новый набор данных под названием LVSum, предназначенный для оценки способности мультимодальных больших языковых моделей (MLLM) создавать резюме длинных видео. Основная сложность, которую призван решить этот проект, заключается в сохранении временной достоверности при работе с протяженными материалами, где модели часто теряют связь между семантическим содержанием и конкретными моментами времени.

Бенчмарк включает в себя 72 разнородных видеоролика, охватывающих 13 различных предметных областей. Средняя продолжительность каждого видео составляет 16 минут. Уникальной особенностью набора данных является наличие до 10 человеческих аннотаций-резюме для каждого ролика, которые содержат точные временные привязки, что позволяет проводить детальную оценку выравнивания текста и видеоряда.

Внедрение LVSum создает стандартизированную основу для тестирования алгоритмов, требующих не просто общего понимания сюжета, но и точного указания временных интервалов событий. Это отличается от предыдущих подходов, где акцент часто делался исключительно на семантической корректности без строгой проверки хронологической последовательности.