EvolvingLMMs-Lab/LLaVA-OneVision-2
Fully Open Framework for Democratized Multimodal Training
解決する課題
LLaVA-OneVision-2は、単一のアーキテクチャ内で画像、長時間動画、空間理解を統合するために設計されたマルチモーダルモデルです。多くのオープンマルチモーダルモデルが2Dの単一画像タスクに限定されていたり、コンテキストウィンドウの制約や非効率なトークン使用により長時間動画の処理に苦戦したりするという限界に対処しています。
仕組み
本プロジェクトは、HEVC動画圧縮を模倣する「コーデック整合型」ビジョンエンコーダー(OneVision-Encoder)を利用しています。フレームを均一にサンプリングするのではなく、高密度なIフレームを保持し、Pフレームからモーションや残差が豊富なパッチのみを選択します。これにより、同じトークン予算内で標準サンプリングの3倍の時間範囲をカバーできます。
重要なのは、モデルがすべてのモダリティ(画像、均一フレーム、コーデック整合型トークン)に対して単一の統合エンコーダーを使用し、共有位置スキームを用いることで、タスク固有のアダプターや個別のトークナイザーの必要性を排除している点です。学習は4段階のカリキュラムに従います:動画能力のブートストラップ、指示チューニング、長時間動画への拡張、空間およびトラッキングスキルの洗練化。
対象者
本プロジェクトは、長時間動画の推論、3D対応の空間レイアウトの理解、高解像度ドキュメントやOCRの処理に対応する、高性能で完全にオープンなマルチモーダルモデルを必要とするAI研究者や開発者向けです。
ハイライト
- 統合アーキテクチャ: タスク固有のアダプターなしで、画像、長時間動画、空間推論を処理する単一の8Bモデル。
- コーデック整合型エンコーディング: モーション豊富なパッチに焦点を当てることで長時間動画を効率的に処理し、時間カバレッジを向上させます。
- 完全オープン: エンコーダー重み、学習コード、設定、完全な学習ログを含むパイプライン全体を公開。
- 包括的なデータセット: 高密度動画キャプションと3D対応の空間推論のための専門データセットを含む。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト