cambrian-mllm/cambrian-s

Cambrian-S: Towards Spatial Supersensing in Video

What it solves

Cambrian-S は動画理解における空間推論の向上を目的としています。多くのマルチモーダル大規模言語モデル(MLLM)は空間認識が苦手ですが、本プロジェクトは動画における「空間超感知」に特化したモデルとデータセットを提供し、AI が動画シーケンス内の物体の物理的配置や空間関係をよりよく理解できるようにします。

How it works

本プロジェクトは4段階のトレーニングプロセスを採用しています:

  1. Vision-Language Alignment:視覚データとテキストデータを整合させます。
  2. General Image Instruction Tuning:画像上で指示チューニングを行います。
  3. General Video Instruction Tuning:動画データ上で指示チューニングを行います。
  4. Spatial Video Tuning:空間理解のための最終的な専門ステージです。

LFP(Latent Frame Prediction)バージョンのモデルでは、4段目が潜在フレーム予測目的を加える形に変更され、空間能力がさらに強化されます。

Who it’s for

動画ベースのAI、マルチモーダルLLM、そして動画における高精度な空間推論を必要とするアプリケーション(ロボティクスや自律システムなど)に取り組む研究者や開発者向けです。

Highlights

  • Specialized Models:Qwen2.5 と SigLIP2 をベースに、0.5B から 7B パラメータまでのさまざまなモデルサイズを提供。
  • VSI-590K Dataset:空間理解に特化した動画指示チューニング用データセット。
  • VSI-SUPER Benchmark:空間超感知能力を測定するための専用評価スイート。
  • Cambrian-S-3M:300 万件のオープンソース動画指示チューニングデータポイントのコレクション。
  • TPU Support:TorchXLA を使用した TPU 対応のトレーニングコードを提供。