Qwen-RobotWorld: 구현 에이전트를 위한 무한한 세계

Qwen-RobotWorld는 자연어를 보편적인 행동 인터페이스로 활용하여 일반 비디오 생성과 도메인 특화 구현 모델 사이의 격차를 메우는 통합 세계 모델입니다. 20개 이상의 로봇 구현체와 500개 이상의 행동 카테고리를 단일 언어 기반 인터페이스로 표준화함으로써, 조작, 자율 주행, 실내 내비게이션을 아우르는 공동 학습을 가능하게 하고, 한 도메인에서 얻은 물리 지식이 다른 도메인을 강화하도록 합니다.

Dual-Stream Diffusion Architecture

Qwen-RobotWorld는 의미 이해와 시각 생성을 통합하기 위해 dual‑stream Multimodal Diffusion Transformer (MMDiT)를 사용합니다. 이 아키텍처는 두 개의 주요 스트림으로 구성됩니다:

  • Understanding Stream: 고정된 Qwen2.5-VL 인코더에서 의미적 특징을 처리하여 언어 행동 $a_t$를 표현합니다.
  • Generation Stream: 비디오 호환 VAE에서 시각 잠재 변수를 처리하여 시각 상태 $s_t$를 표현합니다.

이 스트림들은 모든 레이어에서 joint attention을 통해 상호 작용하며, 양방향 교차‑모달 융합을 촉진합니다. CLIP이나 T5와 같은 경량 인코더 대신 전체 MLLM (Qwen2.5-VL)을 행동 인코더로 사용함으로써 복잡한 지시문에 대한 깊은 언어 이해를 달성하고, 내부화된 세계 지식을 활용해 로봇 팔의 강직성 유지와 같은 물리적으로 타당한 전이를 보장합니다.

Cross-Embodiment and Multi-View Generation

Scene2Robot Human-to-Robot Transfer

Scene2Robot 메커니즘은 인간 시연을 14가지 서로 다른 로봇 형태로 재타깃팅함으로써 구현체 간 비디오 편집을 가능하게 합니다. 이는 joint attention이 장면 외관과 로봇 움직임 궤적을 동시에 주목하도록 하는 다중 구간 조건화 메커니즘을 통해 구현됩니다. 이 기능은 학습 데이터 규모를 확장하는 엔진이자 추론 시 전이 도구로 활용됩니다.

Geometrically Consistent Multi-View Generation

단일 카메라 시점에서 흔히 발생하는 가림 현상을 없애기 위해 Qwen-RobotWorld는 2–4개의 동기화된 카메라 스트림(주 시점, 손목 장착 시점, 3인칭 시점)을 생성합니다. 모델은 학습 중 동기화된 프레임을 공간적으로 연결하고, 비대칭 3D RoPE를 사용해 공간 인코딩함으로써 아키텍처 변경 없이 3D‑일관된 객체 정체성과 움직임 궤적을 달성합니다. 이러한 다중 시점 일관성은 객체 형태, 깊이, 공간 레이아웃을 학습하도록 하는 기하학적 정규화 역할을 합니다.

Embodied World Knowledge (EWK) Dataset

모델은 Embodied World Knowledge (EWK) 데이터셋으로 학습되며, 이 데이터셋은 네 가지 축을 따라 조직된 8.6M개의 교차 시나리오 학습 쌍을 포함합니다:

  • Multi-Embodiment: 인간 손, 7가지 로봇 팔 구성, 자율 주행 차량, 모바일 에이전트 등 20개 이상의 로봇 모델을 포괄합니다.
  • Multi-Task: 원자적 조작, 장기 복합 작업, 이동성을 아우르는 500개 이상의 행동 카테고리를 포함합니다.
  • Multi-Scenario: 실제 환경(주방, 작업장, 야외)과 포토리얼리스틱 시뮬레이션을 결합합니다.
  • Multi-View: 6M 구현 샘플 중 약 1.6M이 2–4개의 시점 결합을 포함합니다.

Action-Language Mapping

조작에서의 관절 각도와 주행에서의 조향 명령 등 표현 이질성을 해소하기 위해 Qwen-RobotWorld는 모든 행동 신호를 공유된 자연어 공간으로 투사합니다. 다섯 단계의 주석 파이프라인이 정확성을 보장합니다:

  1. Task Goal: 고수준 의도.
  2. Action Detail: 시공간 궤적 및 시점 선언.
  3. Physical Feedback: 관찰 가능한 환경 결과.
  4. Comprehensive Caption: 정밀 예측을 위한 전체 설명.
  5. Concise Caption: 간단한 명령을 위한 핵심 요소.

Training Curriculum

모델은 일반‑전문가 순차 커리큘럼을 따라 기본적인 사전 지식을 구축한 뒤 구현 물리학에 특화됩니다:

단계 데이터 혼합 목표
Pretraining T2I / T2V / TI2V joint + Human interaction (Ego4D, EPIC-Kitchen) 기본 시각 사전 지식 및 잡기/도구 사용 사전 지식 구축
SFT Phase 1 Embodied + general joint training 핵심 조작 물리학
SFT Phase 2 Multi-view expansion 시점 범위 확대
SFT Phase 3 Multi-view concatenation 교차 시점 기하학적 일관성
SFT Phase 4 Complex cross-domain 장기‑수평 및 교차 시나리오 일반화

Performance and Benchmarks

Qwen-RobotWorld는 일반 비디오 생성 모델(예: Sora2, Veo3)과 특화된 구현 세계 모델(예: Cosmos, LVP)을 모두 능가하며 네 가지 핵심 벤치마크에서 우수한 성능을 보입니다:

  • EWMBench (4.60): 강한 움직임 충실도 (HSD 0.566)와 장면 일관성 (0.914)을 입증합니다.
  • DreamGen (4.952): 객체 수준 구성 일반화 (GR1-Object IF: 0.878)에서 강점을 보입니다.
  • WorldModelBench (8.99): 뉴턴 법칙, 질량 보존, 유체 역학, 중력 등 물리 법칙 준수 (1.00)를 완벽히 달성합니다.
  • PBench (0.804): 도메인 이해도 (0.857)와 움직임 부드러움 (0.990)에서 높은 점수를 기록합니다.

Capabilities and Generalization

모델은 강력한 제로샷 능력과 교차 도메인 일반화를 보여줍니다:

  • Fine-Grained Grounding: 지시문에 단일 키워드만 바꾸어도 서로 다른 비디오를 생성합니다(예: "빨간 딸기를 집어 들어라" vs. "노란 감자를 집어 들어라").
  • Cross-Domain Mobility: 조작을 넘어 자율 주행(Bench2Drive, Waymo 등) 및 실내 내비게이션(VLNVerse)까지 일반화합니다.
  • Long-Horizon Reasoning: 여러 객체를 순차적으로 집어 특정 순서대로 배치하는 등 복합적인 다단계 지시를 처리합니다.

Sources