MME-Benchmarks/Video-MME-v2

Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding

解决的问题

Video-MME-v2 是一个旨在评估多模态大语言模型(MLLM)真实视频理解能力的基准测试。它通过引入更稳健且分阶段的评估体系,弥合了现有基准测试中高排行榜分数与实际用户体验之间的差距,防止模型通过“零散命中”或侥幸猜测获得高分。

工作原理

该基准将视频理解分解为三个逐步提升难度的层次:

  1. 一级(多点信息聚合): 测试模型从视频中检索并整合多模态线索(帧、音频、字幕)的能力。
  2. 二级(时间理解): 评估模型捕捉状态变化、动作序列和因果关系的能力。
  3. 三级(时间复杂推理): 测试模型将时间信息与外部世界知识和社会常识相结合的能力。

为确保稳健性,采用 分组非线性评分机制。问题被组织为四个相互关联的问题组。评分基于“相关性”(组内答案的一致性)或“逻辑性”(推理链的连贯性),奖励那些能够一致且逻辑性地正确回答相关问题的模型。

适用对象

本项目适用于需要严格衡量其模型时间推理和多模态融合能力的视频类多模态大语言模型的研究人员和开发者。

亮点

  • 三级渐进式设计: 系统性地从简单信息检索测试到复杂时间推理。
  • 分组非线性评分: 降低对随机正确性的敏感度,更真实反映模型的稳定性和鲁棒性。
  • 语言上下文支持: 提供串联或交错字幕选项,测试文本模态如何辅助推理。
  • 全面的数据集: 包含 800 个视频和 3,200 个由人工标注的问答对,耗时超过 3,300 小时的专业标注工作。
  • 灵活的评估流水线: 支持与 VLMEvalKit、lmms-eval 和 EvalScope 集成,也提供独立的基于 Transformers 的脚本。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目