bytedance/vidi

The official repo for "Vidi: Large Multimodal Models for Video Understanding and Editing"

解決する課題

Vidiは、包括的なビデオ理解と生成の課題に対処します。正確な時間的検索(テキストクエリに基づいてビデオ内の特定の時間範囲を見つける)、時空間グラウンディング(特定の時間枠内でオブジェクトを特定する)、高度なビデオ分析、および自動編集に至るまでのタスクのための統一されたフレームワークを提供します。

仕組み

Vidiは、ビデオ理解と編集(VUE)のために設計された大規模マルチモーダルモデル(LMM)のファミリーです。ビデオ入力を処理して、いくつかの異なる操作を実行します:

  • 理解: 検索による特定のクリップの特定、オブジェクトのバウンディングボックスの描画(グラウンディング)、チャプタータイトルの生成、ハイライトの特定、ビデオコンテンツに関する質問への回答(VQA/Thinking)が可能です。
  • 生成: 「Vidi-Edit」機能を通じて、モデルは複数のアップロードされたビデオを受け取り、ストーリーライン、音楽、エフェクトを備えた編集済みビデオを自動的に生成できます。
  • 評価: プロジェクトには、プロットの理解、時空間グラウンディング、時間的検索におけるパフォーマンスを測定するための複数のベンチマーク(VUE-PLOT, VUE-STG, VUE-TR-V2)が含まれています。

対象者

  • AI研究者: マルチモーダルモデル、ビデオ分析、自動ビデオ編集に取り組んでいる方。
  • 開発者: 高度なビデオ検索およびグラウンディング機能をアプリケーションに統合したいユーザー。
  • コンテンツクリエイター: ビデオの要約、ハイライト、編集のための自動化ツールを必要とする方。

ハイライト

  • マルチタスク能力: グラウンディング、検索、チャプター作成、ハイライト、VQAをサポート。
  • 自動編集: 生のクリップから、音楽やエフェクトを含む完全な編集済みビデオを生成可能。
  • 包括的なベンチマーク: 時空間グラウンディングとプロット理解のための専門的な評価セットを提供。
  • モデルの重み: ファインチューニング用コードとともに、Vidi-7BおよびVidi1.5-9Bモデルへのアクセスを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch