hustvl/Senna
[IJCV 2026] Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
解決的問題
Senna 透過整合大規模視覺語言模型(LVLM),克服了端到端自動駕駛系統的限制,提升在不同情境下的規劃安全性、穩健性與泛化能力。
工作原理
Senna 將視覺語言模型與端到端駕駛模型相連結。它使用基於 Vicuna-7b-v1.5 的 7B 參數模型,處理 6 視角輸入影像,生成場景描述與規劃說明。系統採用三階段訓練:混合預訓練、駕駛微調與規劃微調(支援全參數與 LoRA 微調)。
適用對象
從事自動駕駛、具身智能,以及大規模多模態模型整合於車輛規劃與感知的研究人員與開發者。
主要亮點
- 領先的規劃表現:在規劃準確性方面達成最尖端成果。
- 跨情境泛化能力:展現出強大的遷移與泛化至新駕駛環境的能力。
- 多模態整合:結合多個相機視角的視覺輸入與語言推理,實現駕駛決策。
- 完整的工具鏈:包含用於 QA 數據生成、訓練與預測元動作可視化的腳本。
相關
- 專案
- 專案
- 專案
- 專案
- 專案