OpenGVLab/Ask-Anything

[CVPR2024 Highlight][VideoChatGPT] ChatGPT with video understanding! And many more supported LMs such as miniGPT4, StableLM, and MOSS.

解決的問題

Ask-Anything (VideoChat 系列) 提供了一種就影片和圖像內容進行自然語言對話的方法。它解決了複雜的影片理解挑戰,允許使用者根據影片的視覺內容提出問題並獲得詳細回答。

工作原理

該專案實現了多個版本的 VideoChat,利用不同的大型語言模型 (LLM) 後端。它提供了一種端到端的聊天機器人方法,模型針對影片和圖像聊天進行了指令微調。它還支援與 ChatGPT、StableLM 和 MOSS 等外部 LLM 的顯式通訊,以及透過 MiniGPT-4 與 Vicuna 進行的隱式通訊。

適用對象

從事多模態 AI 研究的研究人員和開發人員,特別是對影片理解、影片-語言模型以及面向視覺媒體的端到端對話式 AI 感興趣的人士。

亮點

  • 多種模型變體:包括 VideoChat、VideoChat2 和 VideoChat3,並具有用於高解析度數據的 VideoChat2_HD 和用於提速的 VideoChat2_phi3 等專用版本。
  • 指令微調:使用包含 200 萬條多樣化指令數據的大規模數據集進行有效微調。
  • 廣泛的 LLM 支援:相容於包括 ChatGPT、StableLM、MOSS 和 Vicuna 在內的各種後端。
  • 全面的基準測試:包括 MVBench,這是一個全面的影片理解基準測試。
  • 長影片支援:結合了 LangChain 和 Whisper 來處理超過一分鐘的影片。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案