EvolvingLMMs-Lab/LLaVA-OneVision-2

Fully Open Framework for Democratized Multimodal Training

What it solves

LLaVA-OneVision-2 は、画像、長時間動画、空間認識を単一アーキテクチャで統合することを目的としたマルチモーダルモデルです。ほとんどのオープンマルチモーダルモデルが 2D の単一画像処理に限定されている、またはトークン予算の制約で長時間動画の処理が困難であるという課題を解決します。

How it works

本プロジェクトは、HEVC の概念を取り入れたコーデックに合わせたビジョンエンコーダ(OneVision-Encoder)を利用します。均一フレームサンプリングを行う代わりに、密な I フレームを保持し、P フレームからは動き情報と残差情報が豊富なパッチだけを抽出します。これにより、同じトークン予算内で標準パイプラインの 3 倍の時間範囲をカバーできます。画像、均一フレーム、コーデックに合わせたトークンというすべてのモダリティが、共有位置スキームを用いた同一エンコーダで処理され、タスク固有のアダプタが不要になります。

Who it’s for

長時間動画推論、3D 対応空間推論、高解像度文書/OCR 分析が可能なモデルの訓練・デプロイに、完全にオープンで再現性のあるフレームワークを必要とするマルチモーダル AI 分野の開発者や研究者向けです。

Highlights

  • Unified Architecture: One model handles images, long videos, and spatial reasoning without modality-specific routing.
  • Codec-Aligned Encoding: Efficiently processes long videos by selecting only high-information patches.
  • Fully Open: Releases the entire pipeline, including encoder weights, training code, configs, and full training logs.
  • Comprehensive Datasets: Includes specialized datasets for dense video captioning and 3D-aware spatial reasoning.