QwenLM/Qwen-Drive-1.0
An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
解决的问题
Qwen-Drive-1.0 是一个专为自动驾驶设计的视觉语言基础模型。它解决了在单一模型架构中处理 3D 感知、驾驶场景视觉问答(VQA)和运动规划(生成未来自车轨迹)的统一框架需求。
工作原理
该模型基于预训练的 Qwen3.5-4B 视觉语言模型(VLM)构建,该模型作为共享表示引擎。两个专门的外部模块附加到此共享 VLM 上:
- BEV 感知头:执行 3D 物体检测、语义占用预测和鸟瞰图(BEV)地图分割,为 3D 场景结构提供显式接口。
- 规划专家:基于共享 VLM 表示生成未来自车轨迹。
- LLM 解码器:原始解码器保持不变,用于处理通用和驾驶特定的 VQA 任务。
该模型采用分阶段训练策略,将驾驶特定监督与通用视觉语言数据相结合,在保持通用视觉理解的同时获得专门的驾驶能力。
适用对象
该项目面向从事自动驾驶、具身智能以及应用于机器人和车辆导航的视觉语言模型(VLM)的研究人员和开发人员。
亮点
- 统一框架:将感知、语言和规划集成到一个模型中。
- 多模态能力:处理 3D 感知、驾驶特定 VQA 和运动规划。
- 分阶段训练:平衡专门的驾驶技能与通用指令跟随。
- 灵活推理:支持不同的规划模式,包括模仿训练(SFT)和奖励优化(RL)专家。
- 高性能:在驾驶场景理解和空间接地基准测试中优于其他多个模型。
相关
- 项目
- 项目
- 项目
- 项目