OpenGVLab/InternVideo

[ECCV2024] Video Foundation Models & Data for Multimodal Understanding

解決する課題

InternVideoは、機械がビデオコンテンツを理解し、推論する方法を改善するために設計された一連の基盤モデルを提供します。これはマルチモーダル理解のスケールアップという課題に対処し、AIが長時間のビデオデータを処理し、複雑な文脈推論を実行できるようにします。

仕組み

このプロジェクトは、一連の反復を通じて進化しています:

  • InternVideo (v1): 一般的なビデオ基盤モデルのために、生成学習と識別学習を使用します。
  • InternVideo2: これらのモデルをスケールアップし、より優れたマルチモーダルビデオ理解を実現します。
  • InternVideo2.5: ビデオマルチモーダル大規模言語モデル (MLLMs) のための、長く豊かな文脈モデリングに焦点を当てています。
  • InternVideo3: マルチモーダルな文脈推論のための、効率的な長時間エージェントを実装します。
  • InternVideo-Next: 一般的なビデオ基盤モデルを通じて、真の世界理解を目指します。

これは、理解と生成の両方に使用される大規模なビデオ・テキストデータセットである InternVid によってサポートされています。

対象者

これは主に、ビデオ理解、マルチモーダル学習、およびビデオ中心のAIエージェントの開発に取り組んでいるAI研究者およびエンジニアを対象としています。

ハイライト

  • 反復的なモデルシリーズ: 一般的な基盤モデルから、特化した長文脈およびエージェント推論モデルへの進化。
  • 大規模データ: 最大2億3000万のビデオ・テキストペアを含むデータセットである InternVid を含む。
  • 多様なモデルサイズ: 効率性のために蒸留された小型バージョン (S/B/L) を含む、さまざまなモデルスケールを提供。
  • エージェントの統合: 最新バージョンには、複雑な推論タスクのための長時間エージェントが組み込まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト