La división Apple Machine Learning Research ha presentado un nuevo conjunto de datos llamado LVSum, destinado a evaluar la capacidad de los grandes modelos de lenguaje multimodales (MLLM) para generar resúmenes de videos largos. La complejidad principal que este proyecto busca resolver radica en mantener la fidelidad temporal al trabajar con materiales extensos, donde los modelos a menudo pierden la conexión entre el contenido semántico y los momentos específicos en el tiempo.

El punto de referencia incluye 72 videos heterogéneos que abarcan 13 dominios temáticos diferentes. La duración media de cada video es de 16inutos. Una característica única del conjunto de datos es la presencia de hasta 10 anotaciones-resumen humanas para cada video, las cuales contienen referencias temporales precisas, lo que permite una evaluación detallada de la alineación entre el texto y la secuencia de video.

La implementación de LVSum establece una base estandarizada para probar algoritmos que requieren no solo una comprensión general de la trama, sino también la indicación precisa de los intervalos de tiempo de los eventos. Esto difiere de enfoques anteriores, donde el énfasis se ponía a menudo exclusivamente en la corrección semántica sin una verificación estricta de la secuencia cronológica.