cambrian-mllm/cambrian-s

Cambrian-S: Towards Spatial Supersensing in Video

What it solves

Cambrian-S는 영상 이해에서 공간 추론을 개선하기 위해 설계되었습니다. 많은 멀티모달 대형 언어 모델(MLLM)이 공간 인식에 어려움을 겪는 반면, 이 프로젝트는 영상에서 "공간 초감지"에 특화된 모델과 데이터셋을 제공하여 AI가 영상 시퀀스 내 객체들의 물리적 배치와 공간 관계를 더 잘 이해하도록 돕습니다.

How it works

프로젝트는 네 단계의 학습 프로세스를 사용합니다:

  1. Vision-Language Alignment: 시각 데이터와 텍스트 데이터를 정렬합니다.
  2. General Image Instruction Tuning: 이미지에 대한 지시 튜닝을 수행합니다.
  3. General Video Instruction Tuning: 영상 데이터에 대한 지시 튜닝을 수행합니다.
  4. Spatial Video Tuning: 공간 이해를 위한 최종 전문 단계입니다.

LFP(Latent Frame Prediction) 버전 모델의 경우, 네 번째 단계가 잠재 프레임 예측 목표를 포함하도록 수정되어 공간 능력이 더욱 강화됩니다.

Who it’s for

영상 기반 AI, 멀티모달 LLM, 그리고 영상에서 고정밀 공간 추론이 필요한 애플리케이션(예: 로봇공학 또는 자율 시스템)을 연구·개발하는 연구자와 개발자를 위한 프로젝트입니다.

Highlights

  • Specialized Models: Qwen2.5와 SigLIP2를 기반으로 0.5B에서 7B 파라미터까지 다양한 모델 크기를 제공합니다.
  • VSI-590K Dataset: 공간 이해에 초점을 맞춘 정제된 영상 지시 튜닝 데이터셋.
  • VSI-SUPER Benchmark: 공간 초감지 능력을 측정하기 위한 전용 평가 스위트.
  • Cambrian-S-3M: 300만 개의 오픈소스 영상 지시 튜닝 데이터 포인트 컬렉션.
  • TPU Support: TorchXLA를 사용한 TPU 지원 학습 코드를 제공합니다.