Qwen-RobotManip:對齊解鎖機器人操作基礎模型的規模化
Qwen-RobotManip:對齊解鎖機器人操作基礎模型的規模化
Qwen-RobotManip 是一個視覺-語言-動作(VLA)基礎模型,透過統一的對齊框架與人類到機器人的資料合成管線,實現了在多樣化機器人形態與分布外任務上的最先進泛化能力。
Qwen-RobotManip:對齊解鎖機器人操作基礎模型的規模化
Qwen-RobotManip 是一個具備廣泛適用性的視覺-語言-動作(VLA)基礎模型,證明只有在結合統一的對齊框架時,擴大機器人操作資料才會有效。透過對不同機器人形態、感測器與任務的表徵進行對齊,該模型利用超過 38,100 小時的開源與合成資料,實現了對新場景、未見指令以及跨形態轉移的卓越泛化能力。
統一跨形態對齊框架
Qwen-RobotManip 透過在表徵、動作與行為三個維度上引入對齊,解決了大規模多來源訓練中訊號衝突的問題。
標準化狀態-動作表徵
所有機器人的狀態與動作皆映射至統一的 80 維向量。此向量支援單臂、雙臂、靈巧手以及移動底座的配置。為避免不同形態之間的衝突,使用每維度的二元遮罩,確保梯度僅在與特定訓練機器人相關的已填充槽位傳遞。
相機座標系差分姿態
為了使不同機器人平台上視覺上相似的動作在數值上接近,末端執行器的動作以相機座標系的差分表示,而非機器人基座座標系。模型在交叉注意力層中使用相機位置編碼(Camera Positional Encoding,CaPE)處理相機外參,並將內參編碼為視覺標記,以提升視野感知。
情境內策略適應
模型使用結構化的形態提示——指定機器人平台、執行速度與 FPS——以及歷史觀測-動作片段。這使得 Qwen-RobotManip 能即時調整其策略以適應不同形態與行為模式。訓練期間採用隨機情境抽樣策略,以防止模型依賴動作複製的捷徑。
大規模人類到機器人資料合成
由於機器人操作資料稀缺,Qwen-RobotManip 採用合成管線將第一人稱人類操作影片轉換為機器人示範。
- 管線: 系統將 1,933 小時的第一人稱人類影片轉換為 24,808 小時、涵蓋 15 種不同形態的機器人示範。此過程透過動作重新定位、手部移除與修補、模擬渲染以及深度引導的合成完成。
- 總語料庫: 最終的預訓練語料庫約為 38,100 小時,包含機器人資料(約 11,420 小時)、第一人稱人類資料(約 1,933 小時)以及合成的人類到機器人資料(約 24,808 小時)。
- 策展: 多階段管線透過五個狀態-動作過濾階段(移除噪聲動作並驗證運動學一致性)以及三項跨模態檢查,確保語言指令與影片內容相符,視覺觀測與機器人狀態相匹配,以保證品質。
模型架構與訓練
Qwen-RobotManip 結合 Qwen3.5-4B 視覺-語言骨幹與流匹配擴散變換器(Diffusion Transformer,DiT)動作頭。
訓練分為兩個主要階段:
- 預訓練: 採用雙流共同訓練方法,將 VLA 流(機器人操作資料)與 VLM 流(視覺-語言理解資料)以 9:1 的比例結合。
- 後訓練: 模型在每個基準測試的所有示範資料上進行通用 SFT(監督式微調),並與 VL 與 VLA 資料共同訓練,以提升 OOD 指令遵循能力。
分布外(OOD)泛化效能
Qwen-RobotManip 將 OOD 基準作為成功的主要衡量指標,認為分布內(IID)分數可能僅透過模式匹配取得,並非真正的泛化。
模擬基準
- LIBERO-Plus: Qwen-RobotManip-Context 獲得 91.4% 的整體成功率,顯著優於 $\pi_{0.5}$(84.4%)。在處理相機與機器人擾動方面表現尤為突出。
- RoboTwin-C2R Hard: 模型在「Hard」環境隨機化下達到 69.4% 的成功率,比 $\pi_{0.5}$ 高出 21.5%。
- RoboCasa365: 在「Composite-Unseen」任務(分布外場景的長時程任務)中,模型達到 14.9%,約為次佳模型(5.4%)的三倍。
- EBench: 模型取得 45.6% 的整體成功率,優於 $\pi_{0.5}$(27.1%)及其他基線。
- RoboTwin-IF: 在使用未見範本的指令遵循上,模型達到 72.2% 的平均成功率,較 $\pi_{0.5}$ 高出 22.6 點。
- RoboTwin-XE: 在零樣本跨形態轉移(於 AgileX ALOHA 訓練,於未見機器人測試)中,使用相機座標系的 EEF 表徵使模型達到 23.9% 的成功率,是 $\pi_{0.5}$(eef)的 3.2 倍。
實際環境評估
- 新場景與指令: 內部成功率為 88.6%,分布外成功率為 87.5%,相較於 $\pi_{0.5}$ 的 37.5% 分布外成功率。
- 少樣本適應: 僅在 5 個任務的 130 個示範上微調時,Qwen-RobotManip 在 5 個任務中有 4 個超過基線表現。
- 跨形態技能轉移: 在 CobotMagic 與 ARX 資料上微調的策略,在全新 ARX 任務上(無任何訓練示範)達到 55.0% 的成功率,較未使用統一框架的消融變體提升 4 倍。
- RoboChallenge Table30 v1: Qwen-RobotManip 在通用賽道排名第一,成功率為 45%,比第三名高出 20%。
關於規模化與復原的關鍵發現
- 對齊為前提條件: 研究發現,僅有具備統一跨形態表徵的模型才能呈現清晰的對數線性資料規模化。缺乏對齊時,增加資料會導致不穩定或平坦的規模曲線。
- 雙手協調: 模型在雙手協調任務上達到 40% 的成功率,遠高於 $\pi_{0.5}$(21.2%)。它也是唯一在「將薯條倒入盤子」任務中成功(30% 成功率)的模型。
- 自發復原: 模型展現出反應式錯誤復原能力(例如在抓取滑脫後自動重新嘗試),此行為是從大規模預訓練中自然產生,而非明確編程所致。