hustvl/Senna

[IJCV 2026] Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving

해결하는 문제

Senna는 에ンド투엔드 자율 주행 시스템의 한계를 극복하기 위해 대규모 시각-언어 모델(LVLM)을 통합하여 다양한 시나리오에서 계획의 안전성, 강건성, 일반화 능력을 향상시킵니다.

작동 방식

Senna는 시각-언어 모델과 에ンド투엔드 주행 모델을 연결합니다. Vicuna-7b-v1.5 기반의 7B 파라미터 모델을 사용하여 6개 시점의 입력 이미지를 처리해 장면 설명과 계획 설명을 생성합니다. 시스템은 세 단계로 훈련됩니다: 믹스 사전 훈련, 주행 파인튜닝, 계획 파인튜닝(전체 파라미터 및 LoRA 파인튜닝 모두 지원).

대상 사용자

자율 주행, 몸체 지능, 그리고 대규모 다중 모달 모델을 차량 계획 및 인식에 통합하는 연구자 및 개발자.

주요 특징

  • 최고 수준의 계획 성능: 계획 정확도에서 최고 수준의 성과를 달성.
  • 다양한 시나리오로의 일반화: 새로운 주행 환경으로의 전이 및 일반화 능력이 뛰어남.
  • 다중 모달 통합: 여러 카메라 시점의 시각 입력과 언어 기반 추론을 결합하여 주행 결정을 수행.
  • 포괄적인 도구 세트: QA 데이터 생성, 훈련, 예측된 메타 액션 시각화를 위한 스크립트 포함.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트