Qwen-Drive-1.0 發佈說明 / 更新內容

TL;DR

Qwen-Drive-1.0 是首個用於自動駕駛的視覺語言基礎模型,它在預訓練期間整合了 3D 感知與視覺問答 (VQA),並延伸至運動規劃。它透過在預訓練的 VLM 上添加外部感知與規劃模組來實現這一點,使其能夠在保持通用視覺語言能力的同時,處理駕駛特定的任務。

模型架構

Qwen-Drive-1.0 是基於原生多模態的 Qwen3.5-4B 構建的。該模型完全保留了原始預訓練 VLM 的架構,轉而利用兩個外部模組,從共享的視覺編碼器與 VLM 路徑中讀取資訊,並處理單視角、多視角以及時序圖像序列。

BEV 感知頭

BEV (Bird's-Eye View) 感知頭充當一個顯式且可檢查的 3D 探針。它從多視角單幀輸入中構建 BEV 表示,以共同執行三個主要任務:

  • 3D 物件偵測
  • 語義佔用預測
  • BEV 地圖分割

在聯合訓練期間,來自此感知頭的損失函數為共享的視覺路徑提供了額外的梯度路徑。

規劃專家

規劃專家 (Planning Expert) 是一個專為 VLM 表示設計的擴散 Transformer (diffusion transformer)。它使用流匹配 (flow matching) 技術來生成 5 秒鐘的自車軌跡。此模組可以選擇性地以文本規劃推理作為條件,來引導軌跡生成。

訓練方法論

為了在不產生災難性遺忘的情況下將通用 VLM 適應於自動駕駛,Qwen-Drive-1.0 採用了分階段訓練與數據配方。此過程包括:

  • Label Unification: 統一跨數據集的標籤。
  • Response Rewriting: 重寫回應以確保一致性。
  • Sample Filtering: 過濾樣本以確保數據品質。
  • Hybrid Supervision: 將駕駛特定數據與通用視覺語言監督結合起來。

性能與基準測試

駕駛場景理解

Qwen-Drive-1.0-SFT 展示了卓越的駕駛場景理解能力,其駕駛 QA 平均得分為 69.43,優於通用 VLM 與駕駛專家模型。關鍵基準測試結果包括:

  • LingoQA: 77.80
  • Ego3D (RMSE): 7.78 (越低越好)
  • WaymoQA (All): 74.47
  • SURDS: 66.13

值得注意的是,該模型在通用知識、推理與識別任務中仍保持高性能,例如在 MMBench 上獲得 85.53 分,在 MMStar 上獲得 75.87 分。

運動規劃

Qwen-Drive-1.0 使用具有統一軌跡格式(10 Hz 下的 5 秒預測)的 283 萬個公開數據樣本進行訓練。它在開環與閉環評估中展現了具競爭力的結果:

  • WOD-E2E (RFS val/test): 8.45 / 7.91
  • WOD-E2E (ADE 5s val/test): 1.27 / 2.67
  • NAVSIM (PDMS): 90.7 (SFT 版本)
  • AlpaSim (at-fault score): 0.37

未來工作

雖然 Qwen-Drive-1.0 為駕駛場景適應建立了統一的基礎,但 Qwen 團隊指出,未來的開發重點將是加強模型文本推理與其生成的軌跡之間的一致性。

Sources