xiaomi-research/recogdrive

[ICLR 2026] ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving

解決する課題

ReCogDriveは、エンドツーエンド自動運転における「ロングテール」問題に対処します。高度な認知推論(通常は視覚言語モデルによって処理される)と運転動作の物理的実行の間のミスマッチを解決します。これらは単純な言語タスクとして扱われると、フォーマットエラー、実現不可能な軌跡、推論の遅延に悩まされることがよくあります。

仕組み

ReCogDriveは、自己回帰型視覚言語モデル(VLM)と拡散プランナーを統合し、理解と計画を統一します。次の3段階のプロセスに従います。

  1. 認知基盤: 階層型データパイプライン(生成、洗練、品質管理)が、人間のような運転認知をVLMに注入します。
  2. アクション生成: VLMが学習した運転の事前知識が拡散プランナーに注入され、連続的で安定した物理的に実現可能な軌跡が生成されます。
  3. 安全性の強化: Diffusion Group Relative Policy Optimization (DiffGRPO) ステージがプランナーを強化し、安全性と快適性を向上させ、衝突を減らします。

対象者

エンドツーエンド自動運転、Vision-Language-Action (VLA) モデル、およびロボット工学の軌跡計画に取り組む研究者およびエンジニア。

ハイライト

  • ハイブリッドアーキテクチャ: VLMの推論能力と拡散プランナーの精度を組み合わせています。
  • 大規模な事前学習: 12のオープンソース運転データセットと、NavSim用のカスタム自動アノテーションパイプラインで事前学習されています。
  • SOTAパフォーマンス: NAVSIMおよびBench2Driveベンチマークで最先端の結果を達成しています。
  • 強化された安全性: DiffGRPOを使用して、より安全で快適な運転操作を特別に最適化します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch