hustvl/Senna

[IJCV 2026] Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving

何を解決するか

Sennaは、エンドツーエンドの自律走行システムの限界を克服するために、大規模な視覚言語モデル(LVLM)を統合し、さまざまなシナリオにおける計画の安全性、堅牢性、汎化能力を向上させます。

動作方法

Sennaは視覚言語モデルとエンドツーエンド走行モデルを橋渡しします。7Bパラメータのモデル(Vicuna-7b-v1.5に基づく)を使用し、6視点の入力画像を処理してシーンの説明と計画の説明を生成します。システムは3段階で訓練されます:ミックス事前学習、走行ファインチューニング、計画ファインチューニング(フルパラメータおよびLoRAファインチューニングの両方をサポート)。

対象ユーザー

自律走行、身体化知能、および大規模なマルチモーダルモデルを車両計画・認識に統合する研究者や開発者。

主な特徴

  • 最先端の計画性能:計画精度において最先端の結果を達成。
  • シナリオ間の汎化能力:新しい走行環境への転送・汎化能力が優れている。
  • マルチモーダル統合:複数のカメラ視点からの視覚入力を言語ベースの推論と組み合わせて走行意思決定を実現。
  • 包括的なツールキット:QAデータ生成、訓練、予測されたメタアクションの可視化用スクリプトを含む。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト