NVlabs/alpamayo1.5

NVIDIA Alpamayo 1.5 Nano is an open 10B reasoning VLA model for autonomous vehicles with reinforcement-learning enhanced reasoning, navigation guidance, and visual question answering.

解決的問題

Alpamayo 1.5 設計用於彌合自動駕駛中高階推理與具體行動預測之間的差距,特別是在「長尾」(稀有或複雜)情境下。它為開發端對端駕駛骨幹或基於推理的自動標記工具提供了基礎。

工作原理

該系統採用包含 Cosmos-Reason 主幹與擴散專家的視覺-語言-動作(VLA)架構。流程遵循兩階段管道:

  1. 推理:視覺-語言模型(VLM)生成「因果鏈」推理軌跡。
  2. 行動:擴散專家根據 VLM 的隱藏狀態,生成軌跡預測(6.4秒預測範圍,10Hz下64個航點)。

Alpamayo 1.5 已透過強化學習(RL)進行後訓練,以提升其推理與生成軌跡之間的對齊度。

適用對象

需要預訓練推理模型來建構客製化駕駛應用、進行科學研究或基準測試的自動駕駛(AV)領域研究者與開發者。

主要亮點

  • 互動式且可調控:支援顯式導航引導與可變數量的輸入攝影機。
  • 多模態能力:既能進行軌跡預測,也能執行通用視覺問答(VQA)。
  • 強化學習後訓練:相比原始 Alpamayo 1,推理品質與軌跡對齊度均有提升。
  • 硬體優化:包含可選的 CUDA 圖加速,以減少擴散專家啟動開銷。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案