Qwen 機器人套件:統一的導航、操作與世界建模基礎模型

TL;DR

Qwen 宣佈了 Qwen‑Robot Suite,這是一組由三個基礎模型組成的套件——Qwen‑RobotNavQwen‑RobotManipQwen‑RobotWorld——將語言層級的智慧轉換為具體的物理動作,使單一的代理系統能在數十種機器人形態下執行導航、操作與世界動態預測。


Qwen‑Robot 套件概述

Qwen‑Robot 套件旨在彌合視覺‑語言理解與具身控制之間長期存在的鴻溝。它透過提供三個專門的基礎模型,將自然語言指令與不同的動作領域對齊:

  • Qwen‑RobotNav – 將語言轉換為導航與駕駛的移動指令。
  • Qwen‑RobotManip – 將語言映射到異構機器人手臂的操作動作。
  • Qwen‑RobotWorld – 從語言條件化的動作預測未來的影片畫格,有效學習世界動態模型。

這三者皆提供 language‑first 介面,允許更高層級的 Qwen 模型(例如 Qwen‑3.7‑Plus)在更廣泛的代理架構中將其作為可重用工具調用。

Qwen‑RobotNav:跨五個領域的統一移動性

關鍵技術貢獻

  • 基於 Qwen3‑VL,模型引入了具有兩個軸向的 parameterised navigation interface:任務模式(指令跟隨、目標搜尋、追蹤、自主駕駛、具身問答)以及四軸 controllable observation protocol(視覺 token 預算、時間衰減、每相機加權、畫格抽樣)。
  • 15.6 M 個導航樣本上進行訓練,同時與視覺‑語言資料共同訓練,以保留具體感知。
  • 採用兩層系統:上層規劃器(Qwen‑3.7‑Plus)分解長期目標,並在劇情中動態切換任務模式與觀測設定。

效能亮點

  • 在五項基準測試上達到最先進的成功率:VLN‑CE RxR 為 76.5 % SR,HM3Dv2 目標物(僅 RGB)為 75.6 % SR,EVT‑Bench 追蹤率為 90.0 %,NAVSIM PDMS 為 91.4 %,以及在三個具身問答資料集上創下新最佳。
  • 參數規模從 2 B 到 8 B 以對數線性方式擴展。
  • 在 Unitree Go2 四足機器人上進行零樣本部署(NVIDIA Jetson Thor,196 ms 延遲),僅使用內建低解析度相機,即可成功執行多房間自然語言指令。

影響 可控觀測協議使單一模型能作為任何代理系統的 可重新配置的導航原語,消除對任務特定架構的需求,並支援具持續記憶的長期推理。

Qwen‑RobotManip:跨形態操作基礎

核心對齊機制

  1. 統一的 80 維狀態‑動作空間,由單臂、雙臂、靈巧手與移動機器人共享。
  2. 相機框架末端執行器增量姿態,使視覺上相似的動作在數值上接近,抽象化形態差異。
  3. 情境內策略適應,將執行歷史視為隱含的形態簽名,允許即時適應。

訓練資料

  • >38 100 小時 的開源資料,包含:
    • 11 320 小時的機器人示範,
    • 1 933 小時的自我視角人類影片,
    • 24 808 小時的機器人示範,這些示範透過 Human‑to‑Robot 流程(動作重新定位、手部移除、模擬渲染、深度導向合成)從人類影片在 15 種形態上合成。

基準測試結果

  • LIBERO‑Plus:91.4 %(較 π0.5 基線提升 +7.0)
  • RoboTwin‑C2R Hard:69.4 %(+21.5)
  • RoboCasa365 Composite‑Unseen:14.9 %(是次佳的 3 倍)
  • EBench:45.6 %(+18.5)
  • RoboTwin‑IF:72.0 %(+22.4)
  • 在 RoboChallenge Table30 v1 Generalist Track 中排名 #1,橫掃前兩名,並以 20 % 的優勢領先第三名。

影響 統一表示被證明是擴展的前提:只有具備 UnifiedSpace + UnifiedEEF 形式的模型在資料量增加時才會呈現清晰的對數線性效能提升。這使得單一策略能處理多樣的操作任務、執行零樣本跨形態轉移,並透過高層次重新規劃從錯誤中恢復。

Qwen‑RobotWorld:語言條件化的世界建模

設計理念

  • 動作僅以 自然語言 表示,將末端執行器姿態、轉向指令與導航路徑點統一於單一介面。
  • Embodied World Knowledge 語料庫 上訓練:8.6 M 個影片‑文字配對,涵蓋超過 200 M 畫格,跨越 20 多種機器人形態與 500 多個動作類別。

模型架構

  • 60 層雙流 MMDiT 結合 Qwen2.5‑VL 語意嵌入與影片潛在向量。
  • 動作編碼器是一個 完整的多模態 LLM(非輕量文字編碼器),使模型能內化物理知識(剛體、流體動力學、重力),並生成物理上合理的未來。

效能與能力

  • 在 EWMBench(運動保真度較第二名提升 +33 %)與 DreamGen Bench 總體排名 第 1 名
  • 在 WorldModelBench(完美符合牛頓物理、質量守恆、流體動力學)與 PBBench 上取得 首個開源 成績。
  • 生成細緻且關鍵字敏感的未來情景(例如將「紅色草莓」換成「黃色馬鈴薯」會相應改變預測結果)。
  • 產生時間與空間一致的多視角影片,促進模擬到實際的轉移與多相機策略訓練。
  • 支援零樣本的人類到機器人轉移:單一的人類示範即可轉化為多種形態的真實機器人執行(例如 Kinova Gen3、KUKA iiwa、xArm7)。

影響 透過學習統一的世界動態模型,Qwen‑RobotWorld 同時充當 合成資料引擎閉環評估器,為套件其他組件提供支援,使操作、導航與駕駛任務相互強化其物理理解。

從模型到代理:閉環

套件的 language‑first API 讓通用的 Qwen 模型可作為 高層規劃器,同時將低層執行委派給專門的套件模型。示範應用包括:

  • 開放式任務執行:Qwen‑Omni 透過語音提出操作任務,實時評估結果,並將執行交給 Qwen‑RobotManip,無需預先定義任務清單。
  • 長期操作:Qwen‑3.5 規劃器將複雜的桌面清潔指令分解為原子子任務;Qwen‑RobotManip 執行每個子任務,使其在分布外場景中仍具韌性,且在失敗後自動重新規劃。
  • 代理式導航與具身問答:結合 Qwen‑RobotNav 與高層規劃器,可在具身問答基準(HM‑EQA、MT‑HM3D、EXPRESS‑Bench)上取得最先進成果,並在實際示範中如在建築內尋找開放式廁所。
  • Chat2Robot 示範:實驗性的網頁介面允許使用者輸入自然語言指令,由 Qwen‑RobotManip 即時執行(目前僅限於 RoboTwin‑Clean 資料集的 50 個任務)。

這些整合說明套件如何成為任何多模態 LLM 的 物理世界工具組,將抽象推理轉化為具體的機器人動作。

未來方向

Qwen 確認了多項未解挑戰:

  • 接觸豐富、長期的任務,需要持續學習。
  • 更緊密、低延遲的通用規劃器與實體執行器耦合。
  • 更豐富的人機環境互動模式(例如觸覺回饋、語音)。

路線圖強調擴展多模態感知、精緻語言‑動作對齊,並擴充套件以涵蓋更多形態與動作類別。

引用

@article{qwenrobotnav,
  title   = {Qwen-RobotNav: A Scalable Navigation Model Designed for an Agentic Navigation System},
  author  = {Qwen Team},
  year    = {2026}
}
@article{qwenrobotmanip,
  title   = {Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models},
  author  = {Qwen Team},
  year    = {2026}
}
@article{qwenrobotworld,
  title   = {Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation},
  author  = {Qwen Team},
  year    = {2026}
}

Sources