Qwen-Robot Suite: 物理世界智能的基礎模型套件

Qwen-Robot Suite 是一套包含三個基礎模型的集合,旨在將通用的多模態智能轉化為物理行動。透過橋接視覺語言表示空間與物理控制之間的差距,該套件使機器人能夠在各種具身形式(embodiments)中進行導航、操作物體並預測世界動態。

Qwen-RobotNav: 統一的物理移動能力

Qwen-RobotNav 在單一組權重下統一了五種導航任務家族——指令遵循、點/目標物導航、目標追蹤以及自動駕駛——。它基於 Qwen3-VL 構建,透過參數化導航介面解決了這些任務不同的記憶體需求。

關鍵技術實現

  • 可控觀察協定 (Controllable Observation Protocol): 模型利用四個軸向(視覺 token 預算、時間衰減、每台攝影機的權重以及影格採樣模式)作為推理時參數。這些參數在訓練期間會進行隨機化,從而實現靈活的配置而無需更改架構。
  • 兩層代理系統 (Two-Tier Agentic System): Qwen-RobotNav 作為一種可重新配置的原語(primitive)。高層規劃器(Qwen3.7-Plus)將長程目標分解為子任務,並動態切換模型的任務模式與上下文策略。
  • 跨具身部署 (Cross-Embodiment Deployment): 該模型展示了零樣本泛化能力,僅使用 Unitree Go2 四足機器人內建的低解析度攝影機即可進行部署,並在 NAVSIM 閉環駕駛中實現了 91.4 PDMS。

性能基準測試

Qwen-RobotNav 在五個領域中實現了最先進(SOTA)的結果,包括在 VLN-CE RxR 上達到 76.5% 的成功率 (SR),以及在 HM3Dv2 目標物導航 (僅 RGB) 上達到 75.6% 的 SR。

Qwen-RobotManip: 可擴展的機器人交互

Qwen-RobotManip 專注於異質具身形式(heterogeneous embodiments)的挑戰,即不同的機器人手臂具有不同的關節配置。它透過將視覺相似的動作對齊到數值接近的空間中,實現了大規模的跨具身訓練。

對齊與擴展

  • 統一狀態-動作表示 (Unified State-Action Representation): 模型使用在單臂、雙臂、靈巧手以及移動具身形式中共享的統一 80 維狀態-動作表示。
  • 攝影機影格增量位姿 (Camera-Frame Delta Poses): 透過使用攝影機座標系下的末端執行器增量位姿,模型抽象化了機器人之間的形態差異。
  • 人到機器人合成 (Human-to-Robot Synthesis): 為了克服數據稀缺問題,一條流水線將自我中心的人類影片轉換為機器人演示。該模型在超過 38,100 小時的數據上進行了訓練,其中包括在 15 種具身形式中合成的 24,808 小時機器人演示。

泛化結果

Qwen-RobotManip 在 RoboChallenge Table30 v1 通用型賽道中排名第一(45% SR)。它展現了顯著的分布外 (OOD) 泛化能力,例如在 LIBERO-Plus 上達到 91.4% 的成功率,以及在 RoboTwin-C2R Hard 上達到 69.4% 的成功率。

Qwen-RobotWorld: 預測性世界動態

Qwen-RobotWorld 是一個世界模型,能根據當前的觀察與自然語言指令進行預測物理世界的未來狀態。它將世界的狀態轉移函數視為一個影片生成任務。

技術架構

  • 語言驅動的動作介面 (Language-Driven Action Interface): 所有動作——包括轉向指令與末端執行器位姿——都以自然語言表示。這使得 20 多種具身形式與 500 多種動作類別能夠使用 Embodied World Knowledge 語料庫(8.6M 影片-文本對)進行共同訓練。
  • 雙流 MMDiT (Dual-Stream MMDiT): 一個 60 層的雙流 MMDiT 將 Qwen2.5-VL 的語義表示與影片潛在空間(latents)耦合。使用完整的多模態 LLM 作為動作編碼器,可確保生成的未來狀態受到內化物理定律(例如重力與流體動力學)的約束。

能力

  • 多視角一致性 (Multi-View Consistency): 模型能從單一指令生成在時間與空間上皆具備一致性的影片,涵蓋多個攝影機視角。
  • 人到機器人轉移 (Human-to-Robot Transfer): 它能根據人類演示生成逼真的機器人執行影片,而無需進行遠端操作。

閉環:從模型到代理 (Agents)

由於 Qwen-Robot Suite 使用語言優先的介面,這些模型可以被通用型 VLM 作為工具來構建複雜的代理系統。

Qwen-RobotClaw

Qwen-RobotClaw 是一個機器人代理框架,允許高層規劃器(例如 Qwen-3.5)調用該套件模型進行物理執行。此架構實現了:

  • 開放式任務執行 (Open-Ended Task Execution): VLM 可以提出任務並即時判斷執行情況,而無需預先定義的清單。
  • 長程操作 (Long-Horizon Manipulation): 複雜指令會被分解為原子級子任務。如果高層規劃器檢測到失敗,它可以重新規劃並發出新的子任務以進行恢復。
  • 具身問答 (Embodied QA): 將代理系統與 Qwen-RobotNav 結合使用,可以實現複雜的探索,例如在建築物中搜尋特定房間,並在回答使用者查詢之前,透過視覺證據驗證其狀態。

Sources