Qwen 로봇 스위트: 내비게이션, 조작 및 세계 모델링을 위한 통합 기반 모델
Qwen 로봇 스위트: 내비게이션, 조작 및 세계 모델링을 위한 통합 기반 모델
Qwen은 Qwen‑Robot Suite를 소개했습니다—내비게이션, 조작 및 세계 예측 행동으로 언어를 변환하는 세 가지 기반 모델(RobotNav, RobotManip, RobotWorld)로, 수십 개의 구현체에 걸쳐 통합된 에이전트 로봇을 가능하게 합니다.
Qwen 로봇 스위트: 내비게이션, 조작 및 세계 모델링을 위한 통합 기반 모델
TL;DR
Qwen은 Qwen‑Robot Suite를 발표했습니다. 이 세 가지 기반 모델—Qwen‑RobotNav, Qwen‑RobotManip, Qwen‑RobotWorld—은 언어 수준의 지능을 구체적인 물리적 행동으로 변환하여, 단일 에이전트 시스템이 수십 개의 로봇 구현체에 걸쳐 내비게이션, 조작 및 세계 동역학을 예측할 수 있게 합니다.
Qwen‑Robot Suite 개요
Qwen‑Robot Suite는 비전‑언어 이해와 구현된 제어 사이의 오랜 격차를 해소하도록 설계되었습니다. 이를 위해 세 가지 특화된 기반 모델을 제공하며, 각각 자연어 명령을 고유한 행동 영역에 맞춥니다:
- Qwen‑RobotNav – 언어를 내비게이션 및 주행을 위한 이동 명령으로 변환합니다.
- Qwen‑RobotManip – 이질적인 로봇 팔 전반에 걸쳐 언어를 조작 행동에 매핑합니다.
- Qwen‑RobotWorld – 언어 조건부 행동으로부터 미래 비디오 프레임을 예측하여, 효과적으로 세계 동역학 모델을 학습합니다.
세 모델 모두 language‑first 인터페이스를 제공하여, 고수준 Qwen 모델(예: Qwen‑3.7‑Plus)이 보다 넓은 에이전트 아키텍처 내에서 재사용 가능한 도구로 호출할 수 있게 합니다.
Qwen‑RobotNav: 다섯 영역에서 통합 이동성
핵심 기술 기여
- Qwen3‑VL을 기반으로, 모델은 두 축을 갖는 parameterised navigation interface를 도입합니다: 작업 모드(명령 수행, 객체 탐색, 추적, 자율 주행, 구현형 질문 응답)와 네 축 controllable observation protocol (시각 토큰 예산, 시간 감쇠, 카메라별 가중치, 프레임 샘플링).
- 15.6 M navigation samples로 학습했으며, 시각‑언어 데이터와 공동 학습하여 기반 인식을 유지합니다.
- 2단계 시스템을 사용합니다: 상위 레벨 플래너(Qwen‑3.7‑Plus)가 장기 목표를 분해하고 에피소드 중간에 작업 모드와 관찰 설정을 동적으로 전환합니다.
성능 하이라이트
- 다섯 벤치마크에서 최첨단 성공률을 기록했습니다: VLN‑CE RxR에서 76.5 % SR, HM3Dv2 객체‑목표(RGB‑only)에서 75.6 % SR, EVT‑Bench에서 90.0 % 추적률, NAVSIM에서 91.4 % PDMS, 그리고 세 개의 Embodied QA 데이터셋에서 새로운 최고 기록.
- 파라미터 수가 2 B에서 8 B까지 로그 선형적으로 확장됩니다.
- Unitree Go2 사족보행 로봇(NVIDIA Jetson Thor, 196 ms 지연)에서 내장 저해상도 카메라만 사용해 제로샷 배포가 가능하며, 다중 방에 걸친 자연어 명령을 성공적으로 수행합니다.
시사점 controllable observation protocol은 단일 모델이 모든 에이전트 시스템을 위한 재구성 가능한 내비게이션 기본 요소로 작동하도록 하여, 작업‑특화 아키텍처의 필요성을 없애고 지속적인 메모리를 활용한 장기 추론을 지원합니다.
Qwen‑RobotManip: 교차 구현체 조작 기반
핵심 정렬 메커니즘
- Unified 80‑dimensional state‑action space는 단일 팔, 이중 팔, 정교한 손, 모바일 로봇이 공유합니다.
- Camera‑frame end‑effector delta poses는 시각적으로 유사한 움직임을 수치적으로 가깝게 만들어 형태학적 차이를 추상화합니다.
- In‑context policy adaptation는 실행 기록을 암묵적인 구현체 서명으로 읽어들여 실시간 적응을 가능하게 합니다.
학습 데이터
- >38 100 hours의 오픈소스 데이터, 구성:
- 로봇 시연 11 320 h,
- 자기 중심 인간 비디오 1 933 h,
- Human‑to‑Robot 파이프라인(동작 재목표화, 손 제거, 시뮬레이션 렌더링, 깊이 기반 합성)을 통해 15개 구현체에 걸쳐 인간 비디오에서 합성된 로봇 시연 24 808 h.
벤치마크 결과
- LIBERO‑Plus: 91.4 % ( +7.0 over π0.5 baseline )
- RoboTwin‑C2R Hard: 69.4 % ( +21.5 )
- RoboCasa365 Composite‑Unseen: 14.9 % ( 3× next best )
- EBench: 45.6 % ( +18.5 )
- RoboTwin‑IF: 72.0 % ( +22.4 )
- #1 순위로 RoboChallenge Table30 v1 Generalist Track에서 1위를 차지했으며, 상위 2위를 모두 차지하고 3위보다 20 % 앞섰습니다.
시사점 통합된 표현이 확장의 전제조건임이 입증되었습니다: UnifiedSpace + UnifiedEEF 형태를 가진 모델만이 데이터 양이 증가함에 따라 깨끗한 로그 선형 성능 향상을 보입니다. 이는 단일 정책이 다양한 조작 작업을 처리하고, 제로샷 교차 구현체 전이 수행하며, 고수준 재계획을 통해 오류에서 복구할 수 있게 합니다.
Qwen‑RobotWorld: 언어 조건부 세계 모델링
설계 철학
- 행동은 오직 자연어로 표현되며, 엔드‑이펙터 자세, 조향 명령, 내비게이션 웨이포인트를 단일 인터페이스로 통합합니다.
- Embodied World Knowledge corpus를 기반으로 학습합니다: 8.6 M 비디오‑텍스트 쌍, >200 M 프레임을 포함하고 20개 이상의 로봇 구현체와 500개 이상의 행동 카테고리를 포괄합니다.
모델 아키텍처
- 60층 듀얼 스트림 MMDiT가 Qwen2.5‑VL 의미 임베딩을 비디오 잠재와 결합합니다.
- 행동 인코더는 전체 멀티모달 LLM(경량 텍스트 인코더가 아님)으로, 모델이 물리 지식(강체, 유체 역학, 중력)을 내재화하고 물리적으로 타당한 미래를 생성하도록 합니다.
성능 및 기능
- EWMBench(모션 충실도에서 2위보다 +33 % 향상)와 DreamGen Bench에서 전체 1위.
- WorldModelBench와 PBBench에서 오픈소스 1위(뉴턴 물리, 질량 보존, 유체 역학을 완벽히 준수).
- 세밀하고 키워드에 민감한 미래를 생성합니다(예: “red strawberry”를 “yellow potato”로 바꾸면 예측 결과가 그에 맞게 변함).
- 시간적·공간적으로 일관된 다중 뷰 비디오를 생성하여 시뮬‑실 전이와 다중 카메라 정책 학습을 촉진합니다.
- 제로샷 인간‑대‑로봇 전이를 가능하게 하며, 단일 인간 시연을 여러 구현체(Kinova Gen3, KUKA iiwa, xArm7 등)에서 현실적인 로봇 실행으로 변환합니다.
시사점 통합된 세계 동역학 모델을 학습함으로써 Qwen‑RobotWorld는 합성 데이터 엔진이자 다른 스위트 구성 요소를 위한 폐쇄 루프 평가자 역할을 수행하여, 조작, 내비게이션, 주행 작업이 서로의 물리적 이해를 강화하도록 합니다.
모델에서 에이전트로: 루프 닫기
스위트의 language‑first API는 범용 Qwen 모델이 고수준 플래너 역할을 수행하고, 저수준 실행을 특화된 스위트 모델에 위임하도록 합니다. 시연된 적용 사례는 다음과 같습니다:
- Open‑ended task execution: Qwen‑Omni가 음성으로 조작 작업을 제안하고, 실시간으로 결과를 평가한 뒤, 사전 정의된 작업 목록 없이 Qwen‑RobotManip에 실행을 넘깁니다.
- Long‑horizon manipulation: Qwen‑3.5 플래너가 복잡한 테이블 위 청소 명령을 원자적 하위 작업으로 분해하고, Qwen‑RobotManip가 각 하위 작업을 실행하여 분포 외 장면에서도 견고한 성능과 실패 후 자동 재계획을 가능하게 합니다.
- Agentic navigation & embodied QA: Qwen‑RobotNav와 고수준 플래너를 결합하면 Embodied Question Answering 벤치마크(HM‑EQA, MT‑HM3D, EXPRESS‑Bench)와 건물 내 열린 화장실 찾기와 같은 실세계 데모에서 최첨단 결과를 얻습니다.
- Chat2Robot demo: 실험용 웹 인터페이스를 통해 사용자는 자연어 명령을 입력하고, Qwen‑RobotManip이 실시간으로 실행합니다(현재 RoboTwin‑Clean 데이터셋의 50개 작업으로 제한).
이러한 통합은 스위트가 모든 멀티모달 LLM을 위한 물리적 세계 도구 세트 역할을 하여, 추상적 추론을 구체적인 로봇 행동으로 전환함을 보여줍니다.
향후 방향
Qwen은 여러 미해결 과제를 제시합니다:
- 접촉이 풍부하고 장기적인 작업으로, 지속적인 학습이 필요합니다.
- 범용 플래너와 물리 실행기 간의 더 긴밀하고 저지연 연계.
- 보다 풍부한 인간‑로봇‑환경 상호작용 양식(예: 촉각 피드백, 음성).
로드맵은 멀티모달 인식 확장, 언어‑행동 정렬 정제, 그리고 스위트가 더 많은 구현체와 행동 카테고리를 포괄하도록 확장하는 데 중점을 둡니다.
Citation
@article{qwenrobotnav,
title = {Qwen-RobotNav: A Scalable Navigation Model Designed for an Agentic Navigation System},
author = {Qwen Team},
year = {2026}
}
@article{qwenrobotmanip,
title = {Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models},
author = {Qwen Team},
year = {2026}
}
@article{qwenrobotworld,
title = {Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation},
author = {Qwen Team},
year = {2026}
}