MME-Benchmarks/Video-MME-v2

Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding

解決的問題

Video-MME-v2 是一個專為評估多模態大語言模型(MLLM)真實影片理解能力而設計的基準。它透過引入更穩健且逐步提升的評估系統,彌補現有基準在高排行榜分數與實際使用者體驗之間的落差,防止模型透過「零散命中」或幸運猜測獲得高分。

工作原理

該基準將影片理解分解為三個逐步提升難度的層級:

  1. 第一級(多點資訊整合): 測試模型從影片中檢索並整合多模態線索(畫面、音訊、字幕)的能力。
  2. 第二級(時間理解): 評估模型捕捉狀態變化、動作序列與因果關係的能力。
  3. 第三級(時間複雜推理): 測試模型將時間資訊與外部世界知識及社會常識結合的能力。

為確保穩健性,採用 分組非線性評分機制。問題被組織為四個相互關聯的問題群組。評分基於「相關性」(群組內答案的一致性)或「邏輯性」(推理鏈的連貫性),獎勵那些能一致且邏輯性地正確回答相關問題的模型。

適用對象

本專案適用於需要嚴謹衡量其模型時間推理與多模態融合能力的影片類多模態大語言模型研究人員與開發者。

亮點

  • 三級漸進式設計: 系統性地從簡單資訊檢索測試到複雜時間推理。
  • 分組非線性評分: 降低對隨機正確性的敏感度,更真實反映模型的穩定性與韌性。
  • 語言上下文支援: 提供串接或交錯字幕選項,測試文字模態如何輔助推理。
  • 全面的資料集: 包含 800 個影片與 3,200 組人工標註的問答對,耗時超過 3,300 小時的專業標註工作。
  • 彈性評估流程: 支援與 VLMEvalKit、lmms-eval 和 EvalScope 集成,也提供獨立的基於 Transformers 的腳本。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案