QwenLM/Qwen-Drive-1.0
An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
解決的問題
Qwen-Drive-1.0 是一個專為自動駕駛設計的視覺語言基礎模型。它解決了在單一模型架構中處理 3D 感知、駕駛場景視覺問答(VQA)和運動規劃(生成未來自車軌跡)的統一框架需求。
工作原理
該模型基於預訓練的 Qwen3.5-4B 視覺語言模型(VLM)構建,該模型作為共享表示引擎。兩個專門的外部模組附加到此共享 VLM 上:
- BEV 感知頭:執行 3D 物體偵測、語義佔用預測和鳥瞰圖(BEV)地圖分割,為 3D 場景結構提供顯式介面。
- 規劃專家:基於共享 VLM 表示生成未來自車軌跡。
- LLM 解碼器:原始解碼器保持不變,用於處理通用和駕駛特定的 VQA 任務。
該模型採用分階段訓練策略,將駕駛特定監督與通用視覺語言數據相結合,在保持通用視覺理解的同時獲得專門的駕駛能力。
適用對象
該專案面向從事自動駕駛、具身智慧以及應用於機器人和車輛導航的視覺語言模型(VLM)的研究人員和開發人員。
亮點
- 統一框架:將感知、語言和規劃整合到一個模型中。
- 多模態能力:處理 3D 感知、駕駛特定 VQA 和運動規劃。
- 分階段訓練:平衡專門的駕駛技能與通用指令跟隨。
- 靈活推論:支援不同的規劃模式,包括模仿訓練(SFT)和獎勵優化(RL)專家。
- 高效能:在駕駛場景理解和空間接地基準測試中優於其他多個模型。
相關
- 專案
- 專案
- 專案
- 專案