Qwen-VLA: 구현 지능을 위한 비전-언어-액션 모델링 통합
Qwen-VLA는 다중모달 대형 언어 모델을 순수히 세계를 이해하는 단계에서 실제로 행동하도록 전환하도록 설계된 범용 비전-언어-액션 (VLA) 모델입니다. 시각 인식, 언어 이해, 공간 추론을 연속적인 행동 생성 및 궤적 예측으로 확장함으로써, Qwen-VLA는 하나의 모델이 다양한 구현체와 환경에서 로봇 작업을 수행할 수 있게 합니다.
구현 작업을 위한 통합 프레임워크
Qwen-VLA는 특화된 작업별 모델을 통합된 일반 정책으로 대체합니다. 로봇 조작과 비전-언어 내비게이션을 하나의 프레임워크로 공식화하여, 모델은 시각 관찰, 언어 지시, 구현체별 조건을 기반으로 다음 행동이나 궤적을 예측합니다. 이 아키텍처는 이해를 위한 Qwen 멀티모달 백본과 연속 행동을 생성하는 전용 액션 디코더를 활용합니다.
4단계 학습 파이프라인
Qwen-VLA는 언어 사전지식 학습부터 폐쇄 루프 제어 달성까지 네 개의 구별된 단계로 진행되는 공동 학습 시스템을 통해 개발됩니다.
단계 I: 텍스트-투-액션 (T2A) 사전학습
초기 단계에서는 VLM을 고정하고 액션 디코더만 언어 및 구현체 프롬프트에 대해 학습합니다. 이 과정은 간단한 언어 지시(예: "빨간 컵을 집어 들어라")로부터 고차원 연속 궤적을 생성하는 것을 언어에서 행동으로의 압축 해제로 취급합니다.
단계 II: 지속적 사전학습 (CPT)
VLM과 액션 디코더를 모두 해제하고 전체 멀티모달 데이터 혼합에 대해 공동 학습합니다. 이 단계는 T2A에서 설정된 언어-행동 사전지식을 구체적인 시각 장면에 정착시켜 Qwen-VLA-Base 모델을 생성합니다.
단계 III: 감독식 미세조정 (SFT)
모델은 CPT 체크포인트에서 두 개의 트랙으로 분기합니다:
- 다중 작업 SFT: 조작, 내비게이션, VQA, 공간 그라운딩에 대한 공동 미세조정.
- 실제 로봇 SFT: 물리적 배치를 위한 내부 텔레오퍼레이션 데이터에 대한 미세조정.
단계 IV: 강화 학습 (RL)
PPO를 사용해 SimplerEnv 시뮬레이션 내에서 폐쇄 루프 작업 성공을 최적화합니다. 이를 통해 최종 Qwen-VLA-Instruct 모델이 생성되며, 미보인 환경 및 로봇 구현체에도 성능이 전이됩니다.
학습 데이터 구성
모델은 다섯 주요 출처에 걸친 방대한 데이터셋으로 학습됩니다:
- 로봇 조작: 공개 데이터 10,000시간 이상, 내부 실제 로봇 궤적 1,000시간 이상, 합성 시뮬레이션 궤적 8백만 건 이상.
- 인간 자가 중심 데이터: Ego4D, EPIC-KITCHENS, Xperience, EgoDex (829시간), EgoVerse (1,300시간 이상, 1,965 작업, 240 장면).
- 합성 시뮬레이션 데이터: 20개의 테이블톱 장면, 200가지 구성, 450개의 작업에 걸친 359,848개의 성공 궤적.
- 텍스트-투-액션 데이터: 6개의 템플릿과 6개의 단일 팔 로봇을 사용한 약 7.2백만 궤적(14,000시간 이상).
- 비전-언어 내비게이션: 장거리 궤적 계획 및 지시 따르기를 위한 데이터.
- 일반 비전-언어 데이터: 13차원에 걸친 48,000개의 세분화된 행동 설명을 포함하여 공간 그라운딩 및 멀티모달 이해를 유지하기 위해 사용됩니다.
성능 및 벤치마크
Qwen-VLA-Instruct는 단일 일반화 모델이 여러 벤치마크에서 전문 모델의 성능에 맞추거나 능가할 수 있음을 보여줍니다:
| 벤치마크 | 최고 전문 모델 | Qwen-VLA |
|---|---|---|
| LIBERO | ABot-M0 (98.6%) | 97.9% |
| RoboCasa-GR1 | ABot-M0 (58.3%) | 56.7% |
| Simpler-WidowX | StarVLA-OFT (64.6%) | 73.7% |
| RoboTwin-Easy / Hard | ABot-M0 (86.0% / 85.0%) | 86.1% / 87.2% |
또한 Qwen-VLA-Instruct는 R2R Val-Unseen에서 69.0% Oracle Success Rate와 57.5% Success Rate를 달성했으며, RxR Val-Unseen에서 비전-언어 내비게이션(VLN-CE) 기준으로 59.6% SR 및 47.8% SPL을 기록해 모든 오픈소스 베이스라인을 앞섰습니다.
실제 환경 일반화 및 동적 장면
Qwen-VLA는 실제 ALOHA 듀얼-암 실험에서 강력한 out-of-distribution (OOD) 일반화를 보여줍니다. 사전 학습된 모델은 도메인 내 평균 성공률 83.6%와 OOD 평균 성공률 76.9%를 달성했으며, 스크래치 학습 모델(48.5% / 36.2%) 및 $\pi_{0.5}$(71.6% / 41.5%)보다 크게 앞섭니다.
모델은 보이지 않는 색상, 물체(예: 채소나 선글라스), 배경 및 조명 조건에 일반화됩니다. 또한 "테이블을 정리해라"와 같은 구성 작업을 처리하며, 여러 목표를 식별하고 다단계 작업을 수행합니다.
DOMINO 벤치마크를 이용한 동적 조작 작업에서 Qwen-VLA-Instruct는 특정 미세조정 없이 26.6% 성공률과 39.5 조작 점수를 기록해 여러 표준 VLA 베이스라인 및 일부 동적 조작 전문 모델보다 우수한 성능을 보였습니다.