OpenGVLab/Ask-Anything
[CVPR2024 Highlight][VideoChatGPT] ChatGPT with video understanding! And many more supported LMs such as miniGPT4, StableLM, and MOSS.
解決的問題
Ask-Anything (VideoChat 系列) 提供了一種就影片和圖像內容進行自然語言對話的方法。它解決了複雜的影片理解挑戰,允許使用者根據影片的視覺內容提出問題並獲得詳細回答。
工作原理
該專案實現了多個版本的 VideoChat,利用不同的大型語言模型 (LLM) 後端。它提供了一種端到端的聊天機器人方法,模型針對影片和圖像聊天進行了指令微調。它還支援與 ChatGPT、StableLM 和 MOSS 等外部 LLM 的顯式通訊,以及透過 MiniGPT-4 與 Vicuna 進行的隱式通訊。
適用對象
從事多模態 AI 研究的研究人員和開發人員,特別是對影片理解、影片-語言模型以及面向視覺媒體的端到端對話式 AI 感興趣的人士。
亮點
- 多種模型變體:包括 VideoChat、VideoChat2 和 VideoChat3,並具有用於高解析度數據的 VideoChat2_HD 和用於提速的 VideoChat2_phi3 等專用版本。
- 指令微調:使用包含 200 萬條多樣化指令數據的大規模數據集進行有效微調。
- 廣泛的 LLM 支援:相容於包括 ChatGPT、StableLM、MOSS 和 Vicuna 在內的各種後端。
- 全面的基準測試:包括 MVBench,這是一個全面的影片理解基準測試。
- 長影片支援:結合了 LangChain 和 Whisper 來處理超過一分鐘的影片。
相關
- 專案
- 專案
- 專案
- 專案
- 專案