OpenGVLab/InternVideo

[ECCV2024] Video Foundation Models & Data for Multimodal Understanding

解决的问题

InternVideo 提供了一系列旨在改进机器理解和推理视频内容方式的基础模型。它解决了扩展多模态理解的挑战,使 AI 能够处理长时程视频数据并进行复杂的上下文推理。

工作原理

该项目通过一系列迭代进行演进:

  • InternVideo (v1): 为通用视频基础模型使用生成式和判别式学习。
  • InternVideo2: 扩展这些模型以实现更好的多模态视频理解。
  • InternVideo2.5: 专注于视频多模态大语言模型 (MLLMs) 的长且丰富的上下文建模。
  • InternVideo3: 实现用于多模态上下文推理的高效长时程智能体。
  • InternVideo-Next: 旨在通过通用视频基础模型实现真正的世界理解。

它由 InternVid 提供支持,这是一个用于理解和生成的规模化视频-文本数据集。

适用对象

这主要面向从事视频理解、多模态学习以及以视频为中心的 AI 智能体开发的 AI 研究人员和工程师。

亮点

  • 迭代模型系列: 从通用基础模型到专门的長上下文和智能体推理模型的演进。
  • 大规模数据: 包括 InternVid,这是一个包含高达 2.3 亿个视频-文本对的数据集。
  • 多样化的模型规模: 提供各种模型规模,包括用于提高效率的蒸馏小型版本 (S/B/L)。
  • 智能体集成: 最新版本结合了用于复杂推理任务的长时程智能体。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目