Qwen-Robot Suite: 물리적 세계 지능을 위한 파운데이션 모델 제품군
Qwen-Robot Suite는 일반적인 멀티모달 지능을 물리적 행동으로 변환하기 위해 설계된 세 가지 파운데이션 모델의 집합입니다. 시각-언어 표현 공간과 물리적 제어 사이의 간극을 메움으로써, 이 제품군은 로봇이 다양한 형태(embodiment)를 통해 탐색하고, 물체를 조작하며, 세계의 역학을 예측할 수 있도록 합니다.
Qwen-RobotNav: 통합된 물리적 이동성
Qwen-RobotNav는 명령 이행, 지점/물체 목표 탐색, 타겟 추적, 자율 주행 등 다섯 가지 탐색 작업군을 단일 가중치 세트로 통합합니다. Qwen3-VL을 기반으로 구축되었으며, 매개변수화된 탐색 인터페이스를 통해 이러한 작업들의 다양한 메모리 요구 사항을 해결합니다.
주요 기술 구현
- 제어 가능한 관찰 프로토콜: 모델은 추론 시 매개변수로 네 가지 축(시각적 토큰 예산, 시간적 감쇠, 카메라별 가중치, 프레임 샘플 모드)을 활용합니다. 이는 훈련 중에 무작위화되어 아키텍처 변경 없이 유연한 구성을 가능하게 합니다.
- 2단계 에이전트 시스템: Qwen-RobotNav는 재구성 가능한 프리미티브(primitive)로 작동합니다. 상위 수준 플래너(Qwen3.7-Plus)는 장기 목표를 하위 작업으로 분해하고 모델의 작업 모드와 컨텍스트 전략을 동적으로 전환합니다.
- 교차 형태(Cross-Embodiment) 배포: 이 모델은 제로샷 일반화 능력을 보여줍니다. Unitree Go2 사족보행 로봇에 내장된 저해상도 카메라만을 사용하여 배포되었으며, NAVSIM 폐쇄 루프 주행에서 91.4 PDMS를 달성했습니다.
성능 벤치마크
Qwen-RobotNav는 다섯 가지 도메인에서 최첨단(SOTA) 결과를 달성했습니다. 여기에는 VLN-CE RxR에서의 76.5% 성공률(SR)과 HM3Dv2 물체 목표 탐색(RGB 전용)에서의 75.6% SR이 포함됩니다.
Qwen-RobotManip: 확장 가능한 로봇 상호작용
Qwen-RobotManip은 서로 다른 로봇 팔이 서로 다른 관절 구성을 갖는 이질적인 형태(heterogeneous embodiments)의 문제를 해결하는 데 집중합니다. 시각적으로 유사한 동작을 수치적으로 근접한 공간으로 정렬함으로써 대규모 교차 형태 훈련을 가능하게 합니다.
정렬 및 확장
- 통합 상태-행동 표현: 모델은 단일 팔, 양팔, 정교한 손(dexterous-hand), 그리고 모바일 형태에 걸쳐 공유되는 통합 80차원 상태-행동 표현을 사용합니다.
- 카메라 프레임 델타 포즈: 카메라 프레임 말단 장치(end-effector) 델타 포즈를 사용함으로써, 모델은 로봇 간의 형태학적 차이를 추상화합니다.
- 인간-로봇 합성: 데이터 부족 문제를 극복하기 위해, 에고센트릭(egocentric) 인간 비디오를 로봇 시연으로 변환하는 파이프라인을 사용합니다. 모델은 15가지 형태에 걸쳐 24,808시간의 합성된 로봇 시연을 포함하여 38,100시간 이상의 데이터로 훈련되었습니다.
일반화 결과
Qwen-RobotManip은 RoboChallenge Table30 v1 제너럴리스트 트랙에서 1위(#1)를 차지했습니다(45% SR). 또한 LIBERO-Plus에서의 91.4% 성공률과 RoboTwin-C2R Hard에서의 69.4% 성공률과 같은 뛰어난 분포 외(OOD) 일반화 능력을 보여줍니다.
Qwen-RobotWorld: 예측적 세계 역학
Qwen-RobotWorld는 현재의 관찰과 자연어 명령을 기반으로 물리적 세계의 미래 상태를 예측하는 월드 모델입니다. 이 모델은 세계의 상태 전이 함수를 비디오 생성 작업으로 취급합니다.
기술 아키텍처
- 언어 주도 행동 인터페이스: 조향 명령과 말단 장치 포즈를 포함한 모든 행동은 자연어로 표현됩니다. 이를 통해 Embodied World Knowledge 코퍼스(8.6M 비디오-텍스트 쌍)를 사용하여 20개 이상의 형태 유형과 500개 이상의 행동 카테고리를 공동 훈련할 수 있습니다.
- Dual-Stream MMDiT: 60계층의 dual-stream MMDiT는 Qwen2.5-VL의 시맨틱 표현을 비디오 잠재 공간(latents)과 결합합니다. 전체 멀티모달 LLM을 행동 인코더로 사용함으로써 생성된 미래가 내재화된 물리 법칙(예: 중력 및 유체 역학)에 의해 제약됨을 보장합니다.
기능
- 다중 뷰 일관성: 모델은 단일 명령으로부터 여러 카메라 시점에서의 시간적 및 공간적으로 일관된 비디오를 생성합니다.
- 인간-로봇 전이: 텔레오퍼레이션(teleoperation) 없이도 인간의 시연을 기반으로 하여 현실적인 로봇 실행 비디오를 생성할 수 있습니다.
루프를 닫다: 모델에서 에이전트로
Qwen-Robot Suite는 언어 우선 인터페이스를 사용하기 때문에, 이러한 모델들은 범용 VLM을 도구로 활용하여 복잡한 에이전트 시스템을 구축할 수 있습니다.
Qwen-RobotClaw
Qwen-RobotClaw는 상위 수준 플래너(예: Qwen-3.5)가 물리적 실행을 위해 제품군 모델들을 호출할 수 있게 하는 로보틱스 에이전트 하네스입니다. 이 아키텍처는 다음과 같은 기능을 가능하게 합니다:
- 개방형 작업 실행: VLM은 사전 정의된 목록 없이 실시간으로으로 작업을 제안하고 실행 여부를 판단할 수 있습니다.
- 장기 조작 작업: 복잡한 명령은 원자적(atomic) 하위 작업으로 분해됩니다. 만약 상위 수준 플래너가 실패를 감지하면, 재계획을 수행하고 새로운 하위 작업을 발행하여 복구할 수 있습니다.
- 체화된 QA(Embodied QA): Qwen-RobotNav와 에이전트 시스템을 결합하면, 건물을 탐색하여 특정 방을 찾고, 사용자의 질문에 답하기 전에 시각적 증거를 통해 상태를 확인하는 것과 같은 복잡한 탐색이 가능해집니다.