OpenGVLab/InternVideo

[ECCV2024] Video Foundation Models & Data for Multimodal Understanding

解決的問題

InternVideo 提供了一系列旨在改進機器理解與推理影片內容方式的基礎模型。它解決了擴展多模態理解的挑戰,使 AI 能夠處理長時程影片數據並進行複雜的上下文推理。

工作原理

該專案透過一系列迭代進行演進:

  • InternVideo (v1): 為通用影片基礎模型使用生成式與判別式學習。
  • InternVideo2: 擴展這些模型以實現更好的多模態影片理解。
  • InternVideo2.5: 專注於影片多模態大語言模型 (MLLMs) 的長且豐富的上下文建模。
  • InternVideo3: 實現用於多模態上下文推理的高效長時程智能體。
  • InternVideo-Next: 旨在透過通用影片基礎模型實現真正的世界理解。

它由 InternVid 提供支持,這是一個用於理解與生成的規模化影片-文本數據集。

適用對象

這主要面向從事影片理解、多模態學習以及以影片為中心的 AI 智能體開發的 AI 研究人員與工程師。

亮點

  • 迭代模型系列: 從通用基礎模型到專門的長上下文與智能體推理模型的演進。
  • 大規模數據: 包括 InternVid,這是一個包含高達 2.3 億個影片-文本對的數據集。
  • 多樣化的模型規模: 提供各種模型規模,包括用於提高效率的蒸餾小型版本 (S/B/L)。
  • 智能體集成: 最新版本結合了用於複雜推理任務的長時程智能體。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案