OpenGVLab/InternVideo
[ECCV2024] Video Foundation Models & Data for Multimodal Understanding
解决的问题
InternVideo 提供了一系列旨在改进机器理解和推理视频内容方式的基础模型。它解决了扩展多模态理解的挑战,使 AI 能够处理长时程视频数据并进行复杂的上下文推理。
工作原理
该项目通过一系列迭代进行演进:
- InternVideo (v1): 为通用视频基础模型使用生成式和判别式学习。
- InternVideo2: 扩展这些模型以实现更好的多模态视频理解。
- InternVideo2.5: 专注于视频多模态大语言模型 (MLLMs) 的长且丰富的上下文建模。
- InternVideo3: 实现用于多模态上下文推理的高效长时程智能体。
- InternVideo-Next: 旨在通过通用视频基础模型实现真正的世界理解。
它由 InternVid 提供支持,这是一个用于理解和生成的规模化视频-文本数据集。
适用对象
这主要面向从事视频理解、多模态学习以及以视频为中心的 AI 智能体开发的 AI 研究人员和工程师。
亮点
- 迭代模型系列: 从通用基础模型到专门的長上下文和智能体推理模型的演进。
- 大规模数据: 包括 InternVid,这是一个包含高达 2.3 亿个视频-文本对的数据集。
- 多样化的模型规模: 提供各种模型规模,包括用于提高效率的蒸馏小型版本 (S/B/L)。
- 智能体集成: 最新版本结合了用于复杂推理任务的长时程智能体。
相关
- 项目
- 项目
- 项目
- 项目
- 项目