OpenBMB/DeepThinkVLA
DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models
🤖 DeepThinkVLA 는 무엇인가요?
DeepThinkVLA는 행동하기 전에 생각하는 것을 배우는 연구용 시각-언어-행동(VLA) 모델입니다. 공개된 pi0‑FAST 체크포인트를 기반으로 하며, 먼저 연쇄적 사고**(CoT)** 추론 흐름을 생성한 후, 단일 순전파에서 로봇의 행동 벡터를 동시에 출력하는 하이브리드 디코더를 추가했습니다. 연구팀은 새로 제작한 에머베디드 CoT 데이터셋을 사용해 LIBERO 시뮬레이션 로봇 벤치마크에서 지도 미세조정**(SFT)** 을 수행한 후, 작업 성공에 맞춰 전체 "생각-행동" 시퀀스를 정렬하는 짧은 강화학습**(RL)** 단계로 개선했습니다.
🎯 핵심 아이디어
| 아이디어 | 왜 중요한가 |
|---|---|
| 하이브리드 어텐션 디코더 | 자기회귀적 추론과 병렬 행동 생성을 분리함으로써, 낮은 지연을 유지하면서도 장면에 대한 추론이 가능합니다. |
| 에머베디드 CoT 데이터셋 | 클라우드 LVLM → 미세조정된 로컬 VLM의 2단계 파이프라인을 통해 로봇 전체 경로에 대한 고품질 추론 흐름을 생성합니다. |
| 성과 기반 강화학습(GRPO) | 희소한 성공 보상과 SFT 정책에 대한 KL 페널티를 사용하여, 장기 작업에서 소폭이지만 일관된 향상**(+2 % SR)** 을 제공합니다. |
| Mask‑CoT 추론 | 추론 시 추론 토큰을 제거함으로써 정확도**(96.5 % SR)** 를 유지하면서도 실행 시간을 0.175× 로 줄입니다. |
📊 보고된 성능
| 메트릭 | 값 |
|---|---|
| LIBERO에서의 평균 성공률(SR) | 97.0 % |
| 순수 자기회귀적 CoT 대비 향상 | +15.5 pp |
| LIBERO‑Long에서의 RL 향상 | +2.0 pp |
| 추론 지연**(Mask‑CoT)** | pi0‑FAST의 0.175× |
| LIBERO Plus에서의 제로샷 성공률**(LIBERO에서만 훈련)** | 0.79 (README에서 상세 분석 참조) |
🛠️ 시작하기
- 환경 – Linux/WSL, Python ≥ 3.10, CUDA 12.x. 일반적인 SFT 실행에는 ≥ 8 × 80 GB GPU 필요. RL 단계는 멀티노드 환경을 전제로 합니다.
- 설치
conda create -n deepthinkvla python=3.10 -y conda activate deepthinkvla pip install -r requirements.txt # Windows에서 egl_probe 오류 수정 (옵션) pip install cmake==3.31.6 wget https://github.com/mhandb/egl_probe/archive/fix_windows_build.zip pip install fix_windows_build.zip - 데이터 및 체크포인트 – 모든 자산은 Hugging Face에 호스팅되어 있습니다. 예: SFT 체크포인트 다운로드
huggingface-cli download --repo-type model \ --resume-download yinchenghust/deepthinkvla_libero_cot_sft \ --local-dir ./checkpoints/sft/ - 훈련 – 지도 미세조정:
강화학습 최적화:bash scripts/finetune.sh # src/train.py 의 deepspeed 실행을 래핑bash scripts/run_deepthinkvla_rl.sh - 평가 – 제공된 평가 스크립트 또는 경량 LIBERO Plus 제로샷 리포지토리 사용:
bash scripts/eval.sh --pretrained_checkpoint yinchenghust/deepthinkvla_libero_cot_rl
📂 리포지토리 구조 (개요)
data/– CoT 데이터셋 및 LIBERO 시뮬레이션 데이터 다운로드 헬퍼scripts/– SFT, RL, 평가용 실행 스크립트src/configs/– DeepSpeed 및 하이퍼파라미터 설정dt_datasets/– 데이터셋 래퍼, 토크나이저, 이미지 정규화experiments/– 평가 유틸리티 및 LIBERO 러너sft/– 모델 정의**(하이브리드 디코더)** 및 트레이너verl/– RL 단계에서 사용되는 VERL PPO 구현
figs/– README에서 사용되는 그림들
🧩 언제 DeepThinkVLA를 사용할까?
- 에머베디드 추론 연구 – 로봇 조작 작업에 대해 명시적인 CoT 추적을 생성할 수 있는 모델이 필요할 때
- 지연 민감한 로봇 제어 – 하이브리드 디코더로 추론 속도를 유지하면서도 추론의 이점을 누릴 수 있음
- 벤치마크 평가 – LIBERO 스위트용 스크립트와 체크포인트 제공, 새로운 LIBERO Plus 벤치마크에서 제로샷 평가 가능
- 데이터셋 생성 – 2단계 CoT 파이프라인은 다른 로봇-비전 데이터셋에도 적용 가능
📚 추가 읽기 및 인용
- 논문: DeepThinkVLA: Enhancing Reasoning Capability of Vision‑Language‑Action Models (arXiv:2511.15669, 2025)
- 관련 리포지토리: SimpleVLA‑RL, Qwen2‑VL‑Finetune, HybridFlow, LeRobot, openpi
- 인용 (README에 BibTeX 제공)
DeepThinkVLA는 짧고 명시적인 추론 단계를 추가함으로써, 시뮬레이션된 로봇 조작 벤치마크에서 성공률을 크게 향상시키면서도 추론 효율성을 유지하는 방법을 보여주는 종합적인 연구 코드베이스입니다. 다중 GPU 클러스터에 접근 가능한 누구나 결과를 재현하거나 새로운 에머베디드 AI 작업에 아이디어를 확장할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트