hustvl/Senna
[IJCV 2026] Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
何を解決するか
Sennaは、エンドツーエンドの自律走行システムの限界を克服するために、大規模な視覚言語モデル(LVLM)を統合し、さまざまなシナリオにおける計画の安全性、堅牢性、汎化能力を向上させます。
動作方法
Sennaは視覚言語モデルとエンドツーエンド走行モデルを橋渡しします。7Bパラメータのモデル(Vicuna-7b-v1.5に基づく)を使用し、6視点の入力画像を処理してシーンの説明と計画の説明を生成します。システムは3段階で訓練されます:ミックス事前学習、走行ファインチューニング、計画ファインチューニング(フルパラメータおよびLoRAファインチューニングの両方をサポート)。
対象ユーザー
自律走行、身体化知能、および大規模なマルチモーダルモデルを車両計画・認識に統合する研究者や開発者。
主な特徴
- 最先端の計画性能:計画精度において最先端の結果を達成。
- シナリオ間の汎化能力:新しい走行環境への転送・汎化能力が優れている。
- マルチモーダル統合:複数のカメラ視点からの視覚入力を言語ベースの推論と組み合わせて走行意思決定を実現。
- 包括的なツールキット:QAデータ生成、訓練、予測されたメタアクションの可視化用スクリプトを含む。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト