hustvl/Senna
[IJCV 2026] Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
What it solves
Senna addresses the limitations of end-to-end autonomous driving systems by integrating a Large Vision-Language Model (LVLM) to improve planning safety, robustness, and generalization across different scenarios.
How it works
Senna bridges a vision-language model with an end-to-end driving model. It utilizes a 7B parameter model based on Vicuna-7b-v1.5, processing 6-view input images to generate scene descriptions and planning explanations. The system is trained in three stages: mix pre-training, driving fine-tuning, and planning fine-tuning (supporting both full-parameter and LoRA fine-tuning).
Who it’s for
Researchers and developers working on autonomous driving, embodied intelligence, and the integration of large multimodal models for vehicle planning and perception.
Highlights
- SOTA Planning Performance: Achieves state-of-the-art results in planning accuracy.
- Cross-Scenario Generalization: Demonstrates strong ability to transfer and generalize to new driving environments.
- Multimodal Integration: Combines visual input from multiple camera views with language-based reasoning for driving decisions.
- Comprehensive Tooling: Includes scripts for QA data generation, training, and visualization of predicted meta-actions.
Related
- Project
- Project
- Project
- Project
- Project