QwenLM/Qwen-Drive-1.0

An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving

解决的问题

Qwen-Drive-1.0 是一个专为自动驾驶设计的视觉语言基础模型。它解决了在单一模型架构中处理 3D 感知、驾驶场景视觉问答(VQA)和运动规划(生成未来自车轨迹)的统一框架需求。

工作原理

该模型基于预训练的 Qwen3.5-4B 视觉语言模型(VLM)构建,该模型作为共享表示引擎。两个专门的外部模块附加到此共享 VLM 上:

  • BEV 感知头:执行 3D 物体检测、语义占用预测和鸟瞰图(BEV)地图分割,为 3D 场景结构提供显式接口。
  • 规划专家:基于共享 VLM 表示生成未来自车轨迹。
  • LLM 解码器:原始解码器保持不变,用于处理通用和驾驶特定的 VQA 任务。

该模型采用分阶段训练策略,将驾驶特定监督与通用视觉语言数据相结合,在保持通用视觉理解的同时获得专门的驾驶能力。

适用对象

该项目面向从事自动驾驶、具身智能以及应用于机器人和车辆导航的视觉语言模型(VLM)的研究人员和开发人员。

亮点

  • 统一框架:将感知、语言和规划集成到一个模型中。
  • 多模态能力:处理 3D 感知、驾驶特定 VQA 和运动规划。
  • 分阶段训练:平衡专门的驾驶技能与通用指令跟随。
  • 灵活推理:支持不同的规划模式,包括模仿训练(SFT)和奖励优化(RL)专家。
  • 高性能:在驾驶场景理解和空间接地基准测试中优于其他多个模型。

相关

  • 项目
  • 项目
  • 项目
  • 项目