xiaomi-research/recogdrive

[ICLR 2026] ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving

解决的问题

ReCogDrive 解决了端到端自动驾驶中的“长尾”问题。它解决了高级认知推理(通常由视觉语言模型处理)与驾驶动作物理执行之间的不匹配问题,当这些动作被视为简单的语言任务时,经常会出现格式错误、不可行的轨迹以及推理速度缓慢的问题。

工作原理

ReCogDrive 将自回归视觉语言模型(VLM)与扩散规划器集成,以统一理解与规划。它遵循一个三阶段的过程:

  1. 认知基础:一个分层数据管道(生成、细化与质量控制)将类人的驾驶认知注入到 VLM 中。
  2. 动作生成:VLM 学习到的驾驶先验知识被注入到扩散规划器中,以生成连续、稳定且物理可行的轨迹。
  3. 安全强化:扩散群组相对策略优化(DiffGRPO)阶段强化了规划器,以提高安全性与舒适度,减少碰撞。

适用对象

从事端到端自动驾驶、视觉-语言-动作(VLA)模型以及机器人轨迹规划的研究人员与工程师。

亮点

  • 混合架构:结合了 VLM 的推理能力与扩散规划器的精确度。
  • 广泛的预训练:在 12 个开源驾驶数据集和一个专为 NavSim 设计的自动化标注管道上进行了预训练。
  • SOTA 性能:在 NAVSIM 和 Bench2Drive 基准测试中取得了最先进的成果。
  • 强化的安全性:使用 DiffGRPO 专门优化更安全、更舒适的驾驶操作。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch