TimeScope:长视频大型多模态模型理解的新基准

Hugging Face 已发布 TimeScope,这是一项开源基准,旨在衡量视觉语言模型(LMM)在处理长视频时的真实时间理解能力。通过在时长从 1 分钟到 8 小时的基础视频中插入短的“针”片段,TimeScope 评估模型是否真正理解事件序列,还是仅仅进行表层的视觉检索。

对时间基准的需求

许多现有的视觉语言模型声称支持能够处理数千帧的超大上下文窗口。然而,Hugging Face 指出,这些说法往往被夸大,因为训练数据通常限制在每个片段 256 帧,这导致随着视频长度增加,性能显著下降。

现有基准,如 Video Needle in a Haystack(VideoNIAH),常使用静态图像作为针,这衡量的是视觉搜索而非时间动态。TimeScope 通过使用短视频片段(5-10 秒)作为针,迫使模型处理时间信息和运动,而不仅仅是识别静态帧,从而填补了这一空白。

TimeScope 基准设计

TimeScope 采用“针在稻草堆中”的方法,将一个或多个手工挑选的短视频针插入长基础视频(例如讲座或纪录片)中。该基准评估三项具体能力:

1. 本地化检索

此任务测试模型在长视频中定位并回答关于特定短片段的问题的能力。该类别的成功通常需要模型从针中抽取相关帧,以识别特定的对象或事件。

2. 信息综合

此任务要求模型识别遍布视频的多个基于文本的针(例如屏幕上显示的“秘密词”),并按正确的时间顺序报告它们。这评估模型扫描整条时间线并理解相对位置的能力。

3. 细粒度时间感知

此任务聚焦于单帧采样无法解决的运动和序列。模型必须感知跨多帧的动态——例如,统计一个人挥斧的次数——以给出正确答案。这探查长上下文处理是否保持时间忠实性。

评估结果与关键发现

对领先的视觉语言模型(包括 Gemini 2.5-Pro 以及多个版本的 Qwen 2.5-VL 和 InternVL 2.5)的初步评估揭示了若干关键洞见:

  • 时间视野限制:大多数模型在视频时长增加时会出现“性能悬崖”。Gemini 2.5-Pro 是唯一在超过一小时的视频上仍保持高准确率的模型。
  • 参数规模与时间能力的关系:增大模型规模并不会自动延伸时间视野。例如,Qwen 2.5-VL 3B 与 7B,以及 InternVL 2.5 系列(2B、4B、8B)的长视频性能曲线几乎相同,均在大致相同的上下文长度处趋于平稳。
  • 任务特定的权衡:模型在三大能力上表现各异。Qwen 2.5-VL 在信息综合(OCR 任务)上表现良好,但在细粒度时间感知(运动计数)上表现不足。

开源可用性

TimeScope 完全开源,以鼓励社区进行基准测试和模型改进。以下资源可供使用:

  • 数据集:托管于 Hugging Face 上的 Apollo-LMMs/TimeScope
  • 排行榜:可通过 Apollo-LMMs/TimeScope 的 Hugging Face Space 访问。
  • 评估框架:已集成到 lmms-eval GitHub 仓库中。

Sources