OpenGVLab/Ask-Anything

[CVPR2024 Highlight][VideoChatGPT] ChatGPT with video understanding! And many more supported LMs such as miniGPT4, StableLM, and MOSS.

解决的问题

Ask-Anything (VideoChat 系列) 提供了一种就视频和图像内容进行自然语言对话的方法。它解决了复杂的视频理解挑战,允许用户根据视频的视觉内容提出问题并获得详细回答。

工作原理

该项目实现了多个版本的 VideoChat,利用不同的大型语言模型 (LLM) 后端。它提供了一种端到端的聊天机器人方法,模型针对视频和图像聊天进行了指令微调。它还支持与 ChatGPT、StableLM 和 MOSS 等外部 LLM 的显式通信,以及通过 MiniGPT-4 与 Vicuna 进行的隐式通信。

适用对象

从事多模态 AI 研究的研究人员和开发人员,特别是对视频理解、视频-语言模型以及面向视觉媒体的端到端对话式 AI 感兴趣的人士。

亮点

  • 多种模型变体:包括 VideoChat、VideoChat2 和 VideoChat3,并具有用于高分辨率数据的 VideoChat2_HD 和用于提速的 VideoChat2_phi3 等专用版本。
  • 指令微调:使用包含 200 万条多样化指令数据的大规模数据集进行有效微调。
  • 广泛的 LLM 支持:兼容包括 ChatGPT、StableLM、MOSS 和 Vicuna 在内的各种后端。
  • 全面的基准测试:包括 MVBench,这是一个全面的视频理解基准测试。
  • 长视频支持:结合了 LangChain 和 Whisper 来处理超过一分钟的视频。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目