cambrian-mllm/cambrian-s
Cambrian-S: Towards Spatial Supersensing in Video
What it solves
Cambrian-S 旨在改进视频理解中的空间推理。许多多模态大型语言模型(MLLM)在空间感知方面表现不佳,而本项目提供专为视频“空间超感知”调优的模型和数据集,使 AI 能更好地理解视频序列中对象的物理布局和空间关系。
How it works
项目采用四阶段训练流程:
- Vision-Language Alignment:对齐视觉和文本数据。
- General Image Instruction Tuning:在图像上进行指令微调。
- General Video Instruction Tuning:在视频数据上进行指令微调。
- Spatial Video Tuning:最后的专门阶段,用于空间理解。
对于 LFP(Latent Frame Prediction)版本的模型,第四阶段会加入潜在帧预测目标,以进一步增强空间能力。
Who it’s for
适用于从事视频 AI、多模态 LLM 以及需要高精度视频空间推理的应用(如机器人或自动驾驶系统)的研究人员和开发者。
Highlights
- Specialized Models:提供从 0.5B 到 7B 参数规模的模型,基于 Qwen2.5 和 SigLIP2。
- VSI-590K Dataset:一个精心策划的视频指令微调数据集,专注于空间理解。
- VSI-SUPER Benchmark:专用的评估套件,用于衡量空间超感知能力。
- Cambrian-S-3M:3 百万条开源视频指令微调数据点的集合。
- TPU Support:提供支持 TPU(使用 TorchXLA)的训练代码。