QwenLM/Qwen-Drive-1.0

An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving

解決的問題

Qwen-Drive-1.0 是一個專為自動駕駛設計的視覺語言基礎模型。它解決了在單一模型架構中處理 3D 感知、駕駛場景視覺問答(VQA)和運動規劃(生成未來自車軌跡)的統一框架需求。

工作原理

該模型基於預訓練的 Qwen3.5-4B 視覺語言模型(VLM)構建,該模型作為共享表示引擎。兩個專門的外部模組附加到此共享 VLM 上:

  • BEV 感知頭:執行 3D 物體偵測、語義佔用預測和鳥瞰圖(BEV)地圖分割,為 3D 場景結構提供顯式介面。
  • 規劃專家:基於共享 VLM 表示生成未來自車軌跡。
  • LLM 解碼器:原始解碼器保持不變,用於處理通用和駕駛特定的 VQA 任務。

該模型採用分階段訓練策略,將駕駛特定監督與通用視覺語言數據相結合,在保持通用視覺理解的同時獲得專門的駕駛能力。

適用對象

該專案面向從事自動駕駛、具身智慧以及應用於機器人和車輛導航的視覺語言模型(VLM)的研究人員和開發人員。

亮點

  • 統一框架:將感知、語言和規劃整合到一個模型中。
  • 多模態能力:處理 3D 感知、駕駛特定 VQA 和運動規劃。
  • 分階段訓練:平衡專門的駕駛技能與通用指令跟隨。
  • 靈活推論:支援不同的規劃模式,包括模仿訓練(SFT)和獎勵優化(RL)專家。
  • 高效能:在駕駛場景理解和空間接地基準測試中優於其他多個模型。

相關

  • 專案
  • 專案
  • 專案
  • 專案