NVlabs/alpamayo1.5

NVIDIA Alpamayo 1.5 Nano is an open 10B reasoning VLA model for autonomous vehicles with reinforcement-learning enhanced reasoning, navigation guidance, and visual question answering.

해결하는 문제

Alpamayo 1.5는 자율 주행에서 고수준 추론과 구체적인 행동 예측 사이의 격차를 메우도록 설계되었으며, 특히 '롱테일'(희귀하거나 복잡한) 시나리오에서 유용합니다. 이는 엔드투엔드 주행 백본 또는 추론 기반 자동 레이블링 도구 개발을 위한 기반을 제공합니다.

작동 방식

이 시스템은 Cosmos-Reason 백본과 확산 전문가를 갖춘 비전-언어-액션(VLA) 아키텍처를 사용합니다. 프로세스는 두 단계의 파이프라인을 따릅니다:

  1. 추론: 비전-언어 모델(VLM)이 '인과 연쇄' 추론 흐름을 생성합니다.
  2. 행동: 확산 전문가가 VLM의 은닉 상태를 조건으로 하여 궤적 예측(6.4초 예측 범위, 10Hz에서 64개의 웨이포인트)을 생성합니다.

Alpamayo 1.5는 강화학습(RL)을 통해 후학습되어 추론과 결과 궤적 간의 일치도를 향상시켰습니다.

대상 사용자

맞춤형 주행 애플리케이션 개발, 과학적 탐구, 벤치마킹을 필요로 하는 자율주행(AV) 분야의 연구자 및 개발자.

주요 특징

  • 인터랙티브하고 조작 가능: 명시적 내비게이션 가이드 및 입력 카메라 수의 가변성을 지원합니다.
  • 다중 모달 기능: 궤적 예측과 일반적인 시각 질문 응답(VQA) 모두 가능합니다.
  • RL 후학습: 원래 Alpamayo 1과 비교해 추론 품질과 궤적 일치도가 향상되었습니다.
  • 하드웨어 최적화: 확산 전문가의 시작 오버헤드를 줄이기 위해 선택적 CUDA 그래프 가속 기능을 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트