hustvl/Senna
[IJCV 2026] Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
解决的问题
Senna 通过整合大视觉语言模型(LVLM),解决了端到端自动驾驶系统存在的局限性,提升了在不同场景下的规划安全性、鲁棒性和泛化能力。
工作原理
Senna 将视觉语言模型与端到端驾驶模型相连接。它使用基于 Vicuna-7b-v1.5 的 7B 参数模型,处理 6 视角输入图像,生成场景描述和规划解释。系统采用三阶段训练:混合预训练、驾驶微调和规划微调(支持全参数和 LoRA 微调)。
适用人群
从事自动驾驶、具身智能以及大模型多模态融合用于车辆规划与感知的研究人员和开发者。
主要亮点
- 领先规划性能:在规划准确性方面达到最先进水平。
- 跨场景泛化能力:展现出强大的向新驾驶环境迁移和泛化的能力。
- 多模态融合:结合多摄像头视角的视觉输入与语言推理,实现驾驶决策。
- 完整工具链:包含用于 QA 数据生成、训练以及预测元动作可视化的脚本。
相关
- 项目
- 项目
- 项目
- 项目
- 项目