OpenGVLab/InternVideo
[ECCV2024] Video Foundation Models & Data for Multimodal Understanding
解決的問題
InternVideo 提供了一系列旨在改進機器理解與推理影片內容方式的基礎模型。它解決了擴展多模態理解的挑戰,使 AI 能夠處理長時程影片數據並進行複雜的上下文推理。
工作原理
該專案透過一系列迭代進行演進:
- InternVideo (v1): 為通用影片基礎模型使用生成式與判別式學習。
- InternVideo2: 擴展這些模型以實現更好的多模態影片理解。
- InternVideo2.5: 專注於影片多模態大語言模型 (MLLMs) 的長且豐富的上下文建模。
- InternVideo3: 實現用於多模態上下文推理的高效長時程智能體。
- InternVideo-Next: 旨在透過通用影片基礎模型實現真正的世界理解。
它由 InternVid 提供支持,這是一個用於理解與生成的規模化影片-文本數據集。
適用對象
這主要面向從事影片理解、多模態學習以及以影片為中心的 AI 智能體開發的 AI 研究人員與工程師。
亮點
- 迭代模型系列: 從通用基礎模型到專門的長上下文與智能體推理模型的演進。
- 大規模數據: 包括 InternVid,這是一個包含高達 2.3 億個影片-文本對的數據集。
- 多樣化的模型規模: 提供各種模型規模,包括用於提高效率的蒸餾小型版本 (S/B/L)。
- 智能體集成: 最新版本結合了用於複雜推理任務的長時程智能體。
相關
- 專案
- 專案
- 專案
- 專案
- 專案