Qwen-RobotWorld:無限世界給具身代理人

Qwen-RobotWorld 是一個統一的世界模型,將自然語言視為通用的動作介面,以彌合通用影片生成與領域特定具身模型之間的差距。透過將 20 多種機器人形態與 500 多個動作類別標準化為單一語言驅動的介面,模型得以在操作、自治駕駛與室內導航之間進行聯合訓練,讓一個領域的物理知識能夠增強其他領域。

雙流擴散架構

Qwen-RobotWorld 使用雙流多模態擴散變換器 (MMDiT) 來整合語意理解與視覺生成。該架構由兩個主要流組成:

  • 理解流:處理來自凍結的 Qwen2.5-VL 編碼器的語意特徵,以表示語言動作 $a_t$。
  • 生成流:處理來自影片相容 VAE 的視覺潛在向量,以表示視覺狀態 $s_t$。

這兩個流在每一層透過聯合注意力互動,促進雙向跨模態融合。透過使用完整的多語言大型模型 (Qwen2.5-VL) 作為動作編碼器,而非 CLIP 或 T5 等輕量編碼器,模型能夠對複雜指令達成更深入的語言理解,並利用內化的世界知識確保物理上合理的轉換,例如維持機器人手臂的剛性。

跨形態與多視角生成

Scene2Robot 人類到機器人轉移

Scene2Robot 機制透過將人類示範重新定位至 14 種不同的機器人形態,實現跨形態影片編輯。此功能藉由多段條件機制與聯合注意力,使模型同時關注場景外觀與機器人運動軌跡。此能力同時作為訓練資料擴增引擎與推論時的轉移工具。

幾何一致的多視角生成

為了消除單相機視角常見的遮蔽,Qwen-RobotWorld 產生 2–4 條同步的相機流(主視角、腕部安裝視角與第三人稱視角)。模型透過在訓練時空間上串接同步影格,並使用非對稱 3D RoPE 進行空間編碼,無需架構修改即可實現 3D 一致的物件身份與運動軌跡。此多視角一致性充當幾何正則化器,教導模型物件形狀、深度與空間佈局。

具身世界知識 (EWK) 資料集

模型在具身世界知識 (EWK) 資料集上進行訓練,該資料集包含 860 萬跨情境訓練配對,依四個維度組織:

  • 多形態:涵蓋 20 多種機器人模型,包括人手、7 種機械手臂配置、自車、以及移動代理。
  • 多任務:包含 500 多個動作類別,涵蓋原子操作、長時程組合與移動。
  • 多情境:結合真實世界資料(廚房、工作坊、戶外)與寫實模擬。
  • 多視角:約 160 萬(在 600 萬具身樣本中)包含 2–4 視角串接。

動作-語言映射

為了解決表徵異質性(例如操作中的關節角度與駕駛中的方向指令之差異),Qwen-RobotWorld 將所有動作訊號投射至共享的自然語言空間。五層標註流程確保精確度:

  1. 任務目標:高層次意圖。
  2. 動作細節:時空軌跡與視角聲明。
  3. 物理回饋:可觀測的環境結果。
  4. 完整說明:完整描述以供精確預測。
  5. 簡潔說明:關鍵要素以供簡短指令。

訓練課程

模型遵循由一般到專家的漸進式課程,在專精具身物理之前先建立基礎先驗:

階段 資料組合 目標
Pretraining T2I / T2V / TI2V 聯合 + 人類互動 (Ego4D, EPIC-Kitchen) 建立基礎視覺先驗與抓取/工具使用先驗
SFT Phase 1 具身 + 通用聯合訓練 核心操作物理
SFT Phase 2 多視角擴展 擴大視角覆蓋
SFT Phase 3 多視角串接 跨視角幾何一致性
SFT Phase 4 複雜跨領域 長時程與跨情境泛化

效能與基準測試

Qwen-RobotWorld 在四項關鍵基準測試中,超越一般影片生成模型(例如 Sora2、Veo3)與專門的具身世界模型(例如 Cosmos、LVP):

  • EWMBench (4.60):展示出強大的運動忠實度(HSD 0.566)與場景一致性(0.914)。
  • DreamGen (4.952):顯示出強大的物件層級組合泛化能力(GR1-Object IF:0.878)。
  • WorldModelBench (8.99):在牛頓定律、質量守恆、流體動力學與重力等方面達到完美的物理遵循度(1.00)。
  • PBench (0.804):展現出強大的領域理解(0.857)與運動平滑度(0.990)。

能力與泛化

模型展現出穩健的零樣本能力與跨領域泛化:

  • 細粒度定位:根據指令中單一關鍵字的變化產生不同影片(例如「撿起紅色草莓」與「撿起黃色馬鈴薯」)。
  • 跨領域移動性:從操作泛化至自治駕駛(使用 Bench2Drive、Waymo 等)與室內導航(使用 VLNVerse)。
  • 長時程推理:處理複雜的多步指令,例如依序撿起多個物件並按特定順序放置。

Sources