xiaomi-research/recogdrive
[ICLR 2026] ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
解決的問題
ReCogDrive 解決了端到端自動駕駛中的「長尾」問題。它解決了高階認知推理(通常由視覺語言模型處理)與駕駛動作物理執行之間的不匹配問題,當這些動作被視為簡單的語言任務時,經常會出現格式錯誤、不可行的軌跡以及推理速度緩慢的問題。
運作方式
ReCogDrive 將自回歸視覺語言模型(VLM)與擴散規劃器整合,以統一理解與規劃。它遵循一個三階段的過程:
- 認知基礎:一個分層數據管道(生成、細化與品質控制)將類人的駕駛認知注入到 VLM 中。
- 動作生成:VLM 學習到的駕駛先驗知識被注入到擴散規劃器中,以生成連續、穩定且物理可行的軌跡。
- 安全強化:擴散群組相對策略優化(DiffGRPO)階段強化了規劃器,以提高安全性與舒適度,減少碰撞。
適用對象
從事端到端自動駕駛、視覺-語言-動作(VLA)模型以及機器人軌跡規劃的研究人員與工程師。
亮點
- 混合架構:結合了 VLM 的推理能力與擴散規劃器的精確度。
- 廣泛的預訓練:在 12 個開源駕駛數據集和一個專為 NavSim 設計的自動化標註管道上進行了預訓練。
- SOTA 效能:在 NAVSIM 和 Bench2Drive 基準測試中取得了最先進的成果。
- 強化的安全性:使用 DiffGRPO 專門優化更安全、更舒適的駕駛操作。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch