Qwen-RobotWorld:無限世界給具身代理人
Qwen-RobotWorld 是一個統一的世界模型,將自然語言視為通用的動作介面,以彌合通用影片生成與領域特定具身模型之間的差距。透過將 20 多種機器人形態與 500 多個動作類別標準化為單一語言驅動的介面,模型得以在操作、自治駕駛與室內導航之間進行聯合訓練,讓一個領域的物理知識能夠增強其他領域。
雙流擴散架構
Qwen-RobotWorld 使用雙流多模態擴散變換器 (MMDiT) 來整合語意理解與視覺生成。該架構由兩個主要流組成:
- 理解流:處理來自凍結的 Qwen2.5-VL 編碼器的語意特徵,以表示語言動作 $a_t$。
- 生成流:處理來自影片相容 VAE 的視覺潛在向量,以表示視覺狀態 $s_t$。
這兩個流在每一層透過聯合注意力互動,促進雙向跨模態融合。透過使用完整的多語言大型模型 (Qwen2.5-VL) 作為動作編碼器,而非 CLIP 或 T5 等輕量編碼器,模型能夠對複雜指令達成更深入的語言理解,並利用內化的世界知識確保物理上合理的轉換,例如維持機器人手臂的剛性。
跨形態與多視角生成
Scene2Robot 人類到機器人轉移
Scene2Robot 機制透過將人類示範重新定位至 14 種不同的機器人形態,實現跨形態影片編輯。此功能藉由多段條件機制與聯合注意力,使模型同時關注場景外觀與機器人運動軌跡。此能力同時作為訓練資料擴增引擎與推論時的轉移工具。
幾何一致的多視角生成
為了消除單相機視角常見的遮蔽,Qwen-RobotWorld 產生 2–4 條同步的相機流(主視角、腕部安裝視角與第三人稱視角)。模型透過在訓練時空間上串接同步影格,並使用非對稱 3D RoPE 進行空間編碼,無需架構修改即可實現 3D 一致的物件身份與運動軌跡。此多視角一致性充當幾何正則化器,教導模型物件形狀、深度與空間佈局。
具身世界知識 (EWK) 資料集
模型在具身世界知識 (EWK) 資料集上進行訓練,該資料集包含 860 萬跨情境訓練配對,依四個維度組織:
- 多形態:涵蓋 20 多種機器人模型,包括人手、7 種機械手臂配置、自車、以及移動代理。
- 多任務:包含 500 多個動作類別,涵蓋原子操作、長時程組合與移動。
- 多情境:結合真實世界資料(廚房、工作坊、戶外)與寫實模擬。
- 多視角:約 160 萬(在 600 萬具身樣本中)包含 2–4 視角串接。
動作-語言映射
為了解決表徵異質性(例如操作中的關節角度與駕駛中的方向指令之差異),Qwen-RobotWorld 將所有動作訊號投射至共享的自然語言空間。五層標註流程確保精確度:
- 任務目標:高層次意圖。
- 動作細節:時空軌跡與視角聲明。
- 物理回饋:可觀測的環境結果。
- 完整說明:完整描述以供精確預測。
- 簡潔說明:關鍵要素以供簡短指令。
訓練課程
模型遵循由一般到專家的漸進式課程,在專精具身物理之前先建立基礎先驗:
| 階段 | 資料組合 | 目標 |
|---|---|---|
| Pretraining | T2I / T2V / TI2V 聯合 + 人類互動 (Ego4D, EPIC-Kitchen) | 建立基礎視覺先驗與抓取/工具使用先驗 |
| SFT Phase 1 | 具身 + 通用聯合訓練 | 核心操作物理 |
| SFT Phase 2 | 多視角擴展 | 擴大視角覆蓋 |
| SFT Phase 3 | 多視角串接 | 跨視角幾何一致性 |
| SFT Phase 4 | 複雜跨領域 | 長時程與跨情境泛化 |
效能與基準測試
Qwen-RobotWorld 在四項關鍵基準測試中,超越一般影片生成模型(例如 Sora2、Veo3)與專門的具身世界模型(例如 Cosmos、LVP):
- EWMBench (4.60):展示出強大的運動忠實度(HSD 0.566)與場景一致性(0.914)。
- DreamGen (4.952):顯示出強大的物件層級組合泛化能力(GR1-Object IF:0.878)。
- WorldModelBench (8.99):在牛頓定律、質量守恆、流體動力學與重力等方面達到完美的物理遵循度(1.00)。
- PBench (0.804):展現出強大的領域理解(0.857)與運動平滑度(0.990)。
能力與泛化
模型展現出穩健的零樣本能力與跨領域泛化:
- 細粒度定位:根據指令中單一關鍵字的變化產生不同影片(例如「撿起紅色草莓」與「撿起黃色馬鈴薯」)。
- 跨領域移動性:從操作泛化至自治駕駛(使用 Bench2Drive、Waymo 等)與室內導航(使用 VLNVerse)。
- 長時程推理:處理複雜的多步指令,例如依序撿起多個物件並按特定順序放置。