A divisão Apple Machine Learning Research apresentou um novo conjunto de dados chamado LVSum, destinado a avaliar a capacidade de Grandes Modelos de Linguagem Multimodais (MLLM) de criar resumos de vídeos longos. O principal desafio que este projeto visa resolver é a manutenção da fidelidade temporal ao trabalhar com materiais extensos, onde os modelos frequentemente perdem a conexão entre o conteúdo semântico e momentos específicos no tempo.

O benchmark inclui 72 vídeos heterogêneos, abrangendo 13 domínios temáticos diferentes. A duração média de cada vídeo é de 16inutos. Uma característica única do conjunto de dados é a presença de até 10 anotações-resumo humanas para cada vídeo, que contêm referências temporais precisas, permitindo uma avaliação detalhada do alinhamento entre texto e sequência de vídeo.

A implementação do LVSum cria uma base padronizada para testar algoritmos que exigem não apenas uma compreensão geral do enredo, mas também a indicação precisa de intervalos de tempo dos eventos. Isso difere de abordagens anteriores, onde o foco era frequentemente colocado exclusivamente na correção semântica, sem uma verificação rigorosa da sequência cronológica.