Apple Machine Learning Research 部門は、マルチモーダル大規模言語モデル(MLLM)が長時間動画の要約を作成する能力を評価することを目的とした「LVSum」と呼ばれる新しいデータセットを発表しました。このプロジェクトが解決しようとする主な課題は、モデルが意味内容と特定の时间点とのつながりをしばしば見失ってしまうような長大な素材を扱う際に、時間的な信頼性を維持することです。

このベンチマークには、13 の異なる分野にわたる 72 本の多様な動画が含まれています。各動画の平均再生時間は 16 分です。このデータセットのユニークな特徴は、各動画に対して最大 10 件の人間によるアノテーション(要約)が存在し、それらが正確な時間参照を含んでいる点であり、これによりテキストと映像シーケンスのアライメントの詳細な評価が可能になります。

LVSum の導入は、単なるストーリーの全体的な理解だけでなく、イベントの時間間隔を正確に示すことを要求されるアルゴリズムのテストのための標準化された基盤を作り出します。これは、従来のアプローチが時間的な順序の厳格な検証なしに意味的な正しさのみに焦点を当てることが多かったのとは対照的です。