QwenLM/Qwen-Drive-1.0
An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
解決する課題
Qwen-Drive-1.0は、自動運転向けに設計された視覚言語基盤モデルです。単一のモデルアーキテクチャ内で、3D知覚、運転シーンに関する視覚質問応答(VQA)、およびモーションプランニング(将来の自車軌跡の生成)を処理できる統合フレームワークの必要性に対応します。
仕組み
このモデルは、共有表現エンジンとして機能する事前学習済みのQwen3.5-4B視覚言語モデル(VLM)を基盤としています。この共有VLMには、2つの専門的な外部モジュールが取り付けられています。
- BEV知覚ヘッド: 3D物体検出、セマンティック占有率予測、および鳥瞰図(BEV)マップセグメンテーションを実行し、3Dシーン構造への明示的なインターフェースを提供します。
- プランニングエキスパート: 共有VLM表現に基づいて将来の自車軌跡を生成します。
- LLMデコーダ: 元のデコーダは変更されず、一般的なVQAタスクと運転特化型VQAタスクの両方を処理します。
このモデルは、運転特化型の教師信号と汎用の視覚言語データを組み合わせた段階的トレーニング戦略を使用して、一般的な視覚理解を維持しながら専門的な運転能力を獲得します。
対象読者
このプロジェクトは、自動運転、具現化知能、およびロボット工学や車両ナビゲーションに適用される視覚言語モデル(VLM)に取り組む研究者や開発者を対象としています。
ハイライト
- 統合フレームワーク: 知覚、言語、プランニングを1つのモデルに統合します。
- マルチモーダル機能: 3D知覚、運転特化型VQA、モーションプランニングを処理します。
- 段階的トレーニング: 専門的な運転スキルと汎用の指示追従のバランスを取ります。
- 柔軟な推論: 模倣学習(SFT)および報酬最適化(RL)エキスパートを含む、さまざまなプランニングモードをサポートします。
- 高性能: 運転シーン理解および空間グラウンディングのベンチマークで、他の複数のモデルを上回ります。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト