Qwen-RobotNav:可擴展的代理系統導航模型

TL;DR

Qwen-RobotNav 是一個建構於 Qwen3-VL 骨幹的可擴展導航模型,將五種不同的導航任務統一於單一組權重之下。它引入了可控制的觀測協議,使代理在推論時能調整視覺上下文,從而在視覺語言導航、目標搜尋、追蹤、自主駕駛以及具身問答等領域達到最先進的表現。

統一多領域導航

Qwen-RobotNav 使用單一模型與單一組權重,在五個導航領域取得最先進(SOTA)成果。效能隨參數量從 2B 到 8B 持續提升。主要基準包括:

  • Vision-Language Navigation (VLN-CE): 8B 模型在 RxR 基準上達到 76.5% 成功率 (SR),在 R2R 上達到 72.1% SR。
  • Object-Goal Navigation (HM3Dv2): 4B 模型僅使用 RGB 觀測即達到 75.6% SR,超越基於深度的方法。
  • Active Visual Tracking (EVT-Bench): 4B 模型達到 90.0% 的追蹤率。
  • Autonomous Driving (NAVSIM): 4B 模型取得 91.4 PDMS,優於專門的駕駛模型。
  • Embodied Question Answering (EQA): 代理系統在三個基準 (HM-EQA、MT-EQA、以及 EXPRESS) 上創下新的 SOTA 成績。

可控制的觀測協議

Qwen-RobotNav 將導航上下文視為第一級、可外部控制的介面。此方法使模型能在不改變架構或重新訓練的情況下,適應不同任務需求——例如指令遵循所需的長期記憶或目標追蹤所需的高時效性。

模型在推論時提供四個控制軸作為參數:

  1. 視覺 token 預算: 在所有相機與時間步上分配的 token 總量。
  2. 時間衰減: 給予近期畫面相較於較舊畫面的權重。
  3. 相機權重: 特定相機的相對重要性(例如優先使用前向相機)。
  4. 畫面抽樣模式: 在全局歷史的隨機抽樣與緊密時效性的最新畫面抽樣之間選擇。

在訓練時,這些參數會在每個樣本上隨機化,確保模型在推論時能泛化至任何配置。

代理導航系統架構

Qwen-RobotNav 被設計為兩層代理系統中的可重新配置原語:

  • 上層規劃器: 由 Qwen3.7-Plus 提供動力,此層將長期目標分解為子目標,並發送可配置的導航呼叫。它能在劇集進行中動態切換任務模式與上下文策略。
  • 導航原語: Qwen-RobotNav 將這些段落作為反應式路徑點預測器執行,透過 4 層 MLP 行動頭輸出 8 個路徑點(每個包含位置與方向)。

為了維持長期推理,系統使用兩層記憶體:每個段落的精簡軌跡摘要,以及持續的「證據筆記本」用以追蹤已搜尋區域與被拒絕的假設。

此架構在 EXPRESS-Bench 上提升了 15.4%,且相較於先前最佳方案減少了 77% 的導航步驟。

訓練與資料管線

模型在五個任務族群上使用 1560 萬樣本進行訓練,並補充視覺語言推理資料。為擴充資料集,Qwen 引入了自動化管線,將文字到影片的生成轉換為導航軌跡。此流程包括提示生成、影片合成、VLM 品質過濾、單目深度估計與運動學過濾,新增了 4 萬張寫實樣本,且不需 3D 場景重建。

真實世界部署與泛化

Qwen-RobotNav 在 Unitree Go2 四足機器人上以零樣本方式部署,使用 NVIDIA Jetson Thor 於裝置端進行推論,達到 196 毫秒(5.1 Hz)的延遲。

僅使用機器人內建的低解析度相機,模型在未見過的環境中展現出強大的泛化能力:

  • 指令遵循: 機器人在展覽廳成功導航 21.78 公尺,並在指令下精確地逆向返回相同路徑。
  • 代理導航: 系統自主處理開放式請求,例如在特定咖啡店尋找綠色雨傘,透過任務分解、以地標定位,並提供基於證據的答案。

Sources