Qwen-Drive-1.0 发布说明 / 新功能介绍

概要

Qwen-Drive-1.0 是首个在预训练阶段整合 3D 感知与视觉问答(VQA)并扩展至运动规划的自动驾驶视觉语言基础模型。它通过向预训练的 VLM 添加外部感知与规划模块,使其能够在保持通用视觉语言能力的同时,处理驾驶相关任务。

模型架构

Qwen-Drive-1.0 基于原生多模态 Qwen3.5-4B 构建。该模型完全保留原始预训练 VLM 架构不变,而是利用两个外部模块,从共享的视觉编码器和 VLM 处理路径读取单视角、多视角及时间序列图像数据。

BEV 感知头

BEV(鸟瞰图)感知头作为一个显式且可检查的 3D 探针。它从多视角单帧输入构建 BEV 表示,联合执行三项主要任务:

  • 3D 目标检测
  • 语义占据预测
  • BEV 地图分割

在联合训练过程中,该头的损失为共享视觉路径提供了额外的梯度传播路径。

规划专家

规划专家是一种专为 VLM 表示设计的扩散 Transformer。它使用流匹配(flow matching)生成 5 秒的自车轨迹。该模块可选择性地基于文本规划推理进行条件化,以引导轨迹生成。

训练方法

为在不造成灾难性遗忘的前提下将通用 VLM 适配至自动驾驶,Qwen-Drive-1.0 采用分阶段训练与数据处理方案。该流程包括:

  • 标签统一:统一跨数据集的标签。
  • 响应重写:重写响应以确保一致性。
  • 样本过滤:过滤样本以保证数据质量。
  • 混合监督:结合驾驶专用数据与通用视觉语言监督。

性能与基准测试

驾驶场景理解

Qwen-Drive-1.0-SFT 在驾驶场景理解方面表现卓越,驾驶问答平均得分达到 69.43,优于通用 VLM 与驾驶专用模型。关键基准测试结果包括:

  • LingoQA:77.80
  • Ego3D (RMSE):7.78(越低越好)
  • WaymoQA (All):74.47
  • SURDS:66.13

值得注意的是,该模型在通用知识、推理与识别任务中仍保持高水平性能,例如在 MMBench 上得分为 85.53,在 MMStar 上得分为 75.87。

运动规划

Qwen-Drive-1.0 在 283 万条公开可用、格式统一的轨迹数据(5 秒预测,10 Hz)上进行训练。其在开环与闭环评估中均表现出色:

  • WOD-E2E (RFS val/test):8.45 / 7.91
  • WOD-E2E (ADE 5s val/test):1.27 / 2.67
  • NAVSIM (PDMS):90.7(SFT 版本)
  • AlpaSim (责任评分):0.37

未来工作

尽管 Qwen-Drive-1.0 为驾驶场景适配建立了统一基础,Qwen 团队指出,未来发展的首要重点是加强模型文本推理与其生成轨迹之间的一致性。

Sources