cambrian-mllm/cambrian-s

Cambrian-S: Towards Spatial Supersensing in Video

What it solves

Cambrian-S 旨在改善影片理解中的空間推理。許多多模態大型語言模型(MLLM)在空間感知方面表現不佳,而本專案提供專為影片「空間超感知」調校的模型與資料集,使 AI 能更好地理解影片序列中物件的物理布局與空間關係。

How it works

本專案採用四階段訓練流程:

  1. Vision-Language Alignment:對齊視覺與文字資料。
  2. General Image Instruction Tuning:在影像上進行指令微調。
  3. General Video Instruction Tuning:在影片資料上進行指令微調。
  4. Spatial Video Tuning:最後的專門階段,用於空間理解。

對於 LFP(Latent Frame Prediction)版本的模型,第四階段會加入潛在畫格預測目標,以進一步提升空間能力。

Who it’s for

適用於從事影片 AI、 多模態 LLM 以及需要高精度影片空間推理的應用(如機器人或自動駕駛系統)的研究人員與開發者。

Highlights

  • Specialized Models:提供從 0.5B 到 7B 參數規模的模型,基於 Qwen2.5 與 SigLIP2。
  • VSI-590K Dataset:一套精心策劃的影片指令微調資料集,專注於空間理解。
  • VSI-SUPER Benchmark:專門的評估套件,用於測量空間超感知能力。
  • Cambrian-S-3M:3 百萬筆開源影片指令微調資料點的集合。
  • TPU Support:提供支援 TPU(使用 TorchXLA)的訓練程式碼。