TimeScope:長影片大型多模態模型理解的新基準
Hugging Face 已發布 TimeScope,一個開源基準,旨在衡量視覺語言模型(LMM)在處理長影片時的實際時間理解能力。透過將短「針」片段插入長度從 1 分鐘到 8 小時的基礎影片,TimeScope 評估模型是否真正理解事件序列,或僅僅執行表層的視覺檢索。
為何需要時間基準測試
許多現有的視覺語言模型聲稱支援巨大的上下文視窗,能處理數千幀的影片。然而,Hugging Face 指出,這些說法往往被誇大,因為訓練資料通常限制在每個片段 256 幀,導致隨著影片長度增加,性能顯著下降。
現有的基準,如 Video Needle in a Haystack(VideoNIAH),常使用靜態圖像作為針,測量的是視覺搜尋而非時間動態。TimeScope 透過使用短影片片段(5–10 秒)作為針,迫使模型處理時間資訊與運動,而不僅僅是辨識靜態畫面,從而填補此缺口。
TimeScope 基準設計
TimeScope 採用「針在稻草堆」的方法,將一個或多個人工挑選的短影片針插入長篇基礎影片(例如講座或紀錄片)中。此基準評估三項具體能力:
1. 本地化檢索
此任務測試模型在長影片中找出並回答關於特定短段落的問題的能力。要在此類別取得成功,模型通常需要從針中抽取相關畫面,以辨識特定物件或事件。
2. 資訊綜合
此任務要求模型辨識散佈於影片各處的多個文字型針(例如螢幕上顯示的「祕密詞」),並依正確的時間順序回報。此可評估模型掃描整個時間軸並理解相對位置的能力。
3. 細緻時間感知
此任務聚焦於無法僅透過單幀抽樣解決的運動與序列。模型必須感知多幀之間的動態,例如計算一個人揮斧的次數,以給出正確答案。此可檢驗長上下文處理是否保留時間真實性。
評估結果與主要發現
對包括 Gemini 2.5-Pro 以及多個版本的 Qwen 2.5-VL 與 InternVL 2.5 在內的領先視覺語言模型的初步評估,揭示了若干關鍵見解:
- 時間視野限制:隨著影片時長增加,多數模型會出現「性能斷崖」。在測試中,只有 Gemini 2.5-Pro 能在超過一小時的影片上保持高準確度。
- 參數規模與時間能力的關係:模型尺寸的增大並不會自動延伸時間視野。例如,Qwen 2.5-VL 3B 與 7B,以及 InternVL 2.5 系列(2B、4B、8B)在長影片上的表現曲線幾乎相同,於大致相同的上下文長度處達到平台期。
- 任務特定的取捨:模型在三個面向上展現不同的強項。Qwen 2.5-VL 在資訊綜合(OCR 任務)表現良好,但在細緻時間感知(運動計數)上表現較差。
開源可用性
TimeScope 完全開源,以鼓勵社群進行基準測試與模型改進。以下資源可供使用:
- 資料集:於 Hugging Face 上的
Apollo-LMMs/TimeScope提供。 - 排行榜:可透過
Apollo-LMMs/TimeScope的 Hugging Face Space 存取。 - 評估框架:已整合至
lmms-evalGitHub 倉庫。