OpenGVLab/VideoChat-Flash

[ICLR2026] VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling

解决的问题

VideoChat-Flash 解决了在处理超长视频(最长可达三小时)时保持高推理速度和准确性的挑战。它通过减少表示视频帧所需的令牌数量,解决了长上下文视频建模中的计算效率低下问题。

工作原理

该项目实现了一种分层压缩架构,将每个视频帧编码为仅 16 个令牌。这种方法使模型能够处理高达 10,000 帧的海量输入,同时比之前的版本快 5 到 10 倍。它基于视频编码器(InternVideo)和大语言模型(Qwen)构建。

适用人群

适用于专注于长视频理解、时间定位和高效视频分析的多模态大语言模型(MLLM)研究人员和开发者。

主要亮点

  • 超长上下文支持:可处理长达三小时的视频。
  • 高效率:将帧编码为 16 个令牌,显著提升推理速度。
  • 强大的检索性能:在 10,000 帧的“针堆中找针”评估中达到 99.1% 的准确率。
  • 多样化的模型选项:提供多种模型尺寸(2B 和 7B)以及针对超长视频输入或短期时间理解的专用版本。

相关

  • 项目
  • 项目
  • 项目
  • 项目