QwenLM/Qwen-Drive-1.0

An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving

해결하는 문제

Qwen-Drive-1.0은 자율 주행을 위해 설계된 비전-언어 기반 모델입니다. 단일 모델 아키텍처 내에서 3D 인식, 운전 장면에 대한 시각 질의 응답(VQA), 모션 플래닝(미래 자아 궤적 생성)을 처리할 수 있는 통합 프레임워크의 필요성을 해결합니다.

작동 방식

이 모델은 공유 표현 엔진 역할을 하는 사전 훈련된 Qwen3.5-4B 비전-언어 모델(VLM)을 기반으로 구축되었습니다. 두 개의 특수 외부 모듈이 이 공유 VLM에 연결됩니다.

  • BEV 인식 헤드: 3D 객체 감지, 의미론적 점유 예측, 조감도(BEV) 맵 세그멘테이션을 수행하여 3D 장면 구조에 대한 명시적 인터페이스를 제공합니다.
  • 플래닝 전문가: 공유 VLM 표현을 기반으로 미래 자아 궤적을 생성합니다.
  • LLM 디코더: 원래 디코더는 변경되지 않으며 일반 및 운전 특화 VQA 작업을 모두 처리합니다.

이 모델은 운전 특화 감독과 일반 목적의 비전-언어 데이터를 결합한 단계적 훈련 전략을 사용하여 일반적인 시각 이해를 유지하면서 전문적인 운전 능력을 습득합니다.

대상 사용자

이 프로젝트는 자율 주행, 구현 지능, 로봇 공학 및 차량 내비게이션에 적용되는 비전-언어 모델(VLM)을 연구하는 연구자와 개발자를 대상으로 합니다.

주요 특징

  • 통합 프레임워크: 인식, 언어, 플래닝을 하나의 모델에 통합합니다.
  • 멀티모달 기능: 3D 인식, 운전 특화 VQA, 모션 플래닝을 처리합니다.
  • 단계적 훈련: 전문적인 운전 기술과 일반 목적의 지시 따르기의 균형을 유지합니다.
  • 유연한 추론: 모방 학습(SFT) 및 보상 최적화(RL) 전문가를 포함한 다양한 플래닝 모드를 지원합니다.
  • 높은 성능: 운전 장면 이해 및 공간 그라운딩 벤치마크에서 여러 다른 모델을 능가합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트