Qwen-VLA:統一視覺-語言-行動建模以實現具身智慧

Qwen-VLA 用統一的通用策略取代了專門的、針對特定任務的模型。它在單一框架下對機器人操作與視覺-語言導航進行建模:模型根據視覺觀測、語言指令以及具身特定條件,預測下一個動作或軌跡。此架構使用 Qwen 多模態骨幹進行理解,並配備專用的行動解碼器以產生連續動作。

統一的具身任務框架

Qwen-VLA 用統一的通用策略取代了專門的、針對特定任務的模型。它在單一框架下對機器人操作與視覺-語言導航進行建模:模型根據視覺觀測、語言指令以及具身特定條件,預測下一個動作或軌跡。此架構使用 Qwen 多模態骨幹進行理解,並配備專用的行動解碼器以產生連續動作。

四階段訓練流程

Qwen-VLA 透過聯合訓練系統開發,從學習語言先驗到實現閉環控制,分為四個不同階段:

階段 I:文字到行動(T2A)預訓練

在此初始階段,VLM 被凍結,僅對行動解碼器進行語言與具身提示的訓練。此過程將從簡單語言指令(例如「拿起紅色杯子」)生成高維連續軌跡視為一種從語言到行動的解壓縮。

階段 II:持續預訓練(CPT)

VLM 與行動解碼器皆解凍,並在完整的多模態資料混合上共同訓練。此階段將 T2A 中建立的語言-行動先驗落實於具體的視覺場景,產生 Qwen-VLA-Base 模型。

階段 III:監督式微調(SFT)

模型從 CPT 檢查點分支為兩條路徑:

  • 多任務 SFT:在操作、導航、VQA 與空間定位上進行聯合微調。
  • 實機機器人 SFT:在內部遠端操作資料上微調,以供實體部署。

階段 IV:強化學習(RL)

使用 PPO,模型在 SimplerEnv 模擬環境中針對閉環任務成功率進行優化。最終產出 Qwen-VLA-Instruct 模型,其效能可遷移至未見過的環境與機器人具身。

訓練資料組成

模型以涵蓋五大來源的大規模資料集進行訓練:

  • 機器人操作:超過 10,000 小時的公開資料、1,000 多小時的內部實機軌跡,以及 800 萬以上的合成模擬軌跡。
  • 人類自我視角資料:來自 Ego4D、EPIC-KITCHENS、Xperience、EgoDex(829 小時)以及 EgoVerse(1,300 多小時、1,965 個任務、240 個場景)的資料。
  • 合成模擬資料:在 20 個桌面場景、200 種配置與 450 個任務中,共有 359,848 條成功軌跡。
  • 文字到行動資料:約 720 萬條軌跡(14,000 多小時),涵蓋 6 種範本與 6 台單臂機器人。
  • 視覺-語言導航:用於長程軌跡規劃與指令遵循的資料。
  • 通用視覺-語言資料:用於保留空間定位與多模態理解,包含 48,000 條跨 13 維度的細緻行動描述。

效能與基準測試

Qwen-VLA-Instruct 展示了單一通用模型在多項基準測試中可匹配或超越專家模型的效能:

基準測試 最佳專家模型 Qwen-VLA
LIBERO ABot-M0 (98.6%) 97.9%
RoboCasa-GR1 ABot-M0 (58.3%) 56.7%
Simpler-WidowX StarVLA-OFT (64.6%) 73.7%
RoboTwin-Easy / Hard ABot-M0 (86.0% / 85.0%) 86.1% / 87.2%

此外,Qwen-VLA-Instruct 在 R2R Val-Unseen 上達到 69.0% 的 Oracle 成功率與 57.5% 的成功率,並在 RxR Val-Unseen 的視覺-語言導航(VLN-CE)上取得 59.6% 的成功率 (SR) 與 47.8% 的 SPL,超過所有開源基準。

真實世界的泛化與動態場景

Qwen-VLA 在真實世界的 ALOHA 雙臂實驗中展現出強大的分布外 (OOD) 泛化能力。預訓練模型在領域內取得 83.6% 的平均成功率,在 OOD 環境取得 76.9% 的平均成功率,顯著優於從頭訓練的模型(48.5% / 36.2%)以及 $\pi_{0.5}$(71.6% / 41.5%)。

模型能泛化至未見過的顏色、物體(例如蔬菜或太陽眼鏡)、背景與光照條件。它亦能處理組合任務,例如「整理桌面」,透過辨識多個目標並執行多步操作。

在使用 DOMINO 基準的動態操作任務中,Qwen-VLA-Instruct 在未進行特定微調的情況下達到 26.6% 的成功率與 39.5 的操作分數,優於多個標準 VLA 基準以及部分動態操作的專家模型。

Sources