cambrian-mllm/cambrian-s
Cambrian-S: Towards Spatial Supersensing in Video
What it solves
Cambrian-S 旨在改善影片理解中的空間推理。許多多模態大型語言模型(MLLM)在空間感知方面表現不佳,而本專案提供專為影片「空間超感知」調校的模型與資料集,使 AI 能更好地理解影片序列中物件的物理布局與空間關係。
How it works
本專案採用四階段訓練流程:
- Vision-Language Alignment:對齊視覺與文字資料。
- General Image Instruction Tuning:在影像上進行指令微調。
- General Video Instruction Tuning:在影片資料上進行指令微調。
- Spatial Video Tuning:最後的專門階段,用於空間理解。
對於 LFP(Latent Frame Prediction)版本的模型,第四階段會加入潛在畫格預測目標,以進一步提升空間能力。
Who it’s for
適用於從事影片 AI、 多模態 LLM 以及需要高精度影片空間推理的應用(如機器人或自動駕駛系統)的研究人員與開發者。
Highlights
- Specialized Models:提供從 0.5B 到 7B 參數規模的模型,基於 Qwen2.5 與 SigLIP2。
- VSI-590K Dataset:一套精心策劃的影片指令微調資料集,專注於空間理解。
- VSI-SUPER Benchmark:專門的評估套件,用於測量空間超感知能力。
- Cambrian-S-3M:3 百萬筆開源影片指令微調資料點的集合。
- TPU Support:提供支援 TPU(使用 TorchXLA)的訓練程式碼。