xiaomi-research/recogdrive

[ICLR 2026] ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving

解決的問題

ReCogDrive 解決了端到端自動駕駛中的「長尾」問題。它解決了高階認知推理(通常由視覺語言模型處理)與駕駛動作物理執行之間的不匹配問題,當這些動作被視為簡單的語言任務時,經常會出現格式錯誤、不可行的軌跡以及推理速度緩慢的問題。

運作方式

ReCogDrive 將自回歸視覺語言模型(VLM)與擴散規劃器整合,以統一理解與規劃。它遵循一個三階段的過程:

  1. 認知基礎:一個分層數據管道(生成、細化與品質控制)將類人的駕駛認知注入到 VLM 中。
  2. 動作生成:VLM 學習到的駕駛先驗知識被注入到擴散規劃器中,以生成連續、穩定且物理可行的軌跡。
  3. 安全強化:擴散群組相對策略優化(DiffGRPO)階段強化了規劃器,以提高安全性與舒適度,減少碰撞。

適用對象

從事端到端自動駕駛、視覺-語言-動作(VLA)模型以及機器人軌跡規劃的研究人員與工程師。

亮點

  • 混合架構:結合了 VLM 的推理能力與擴散規劃器的精確度。
  • 廣泛的預訓練:在 12 個開源駕駛數據集和一個專為 NavSim 設計的自動化標註管道上進行了預訓練。
  • SOTA 效能:在 NAVSIM 和 Bench2Drive 基準測試中取得了最先進的成果。
  • 強化的安全性:使用 DiffGRPO 專門優化更安全、更舒適的駕駛操作。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch