NVlabs/alpamayo1.5

NVIDIA Alpamayo 1.5 Nano is an open 10B reasoning VLA model for autonomous vehicles with reinforcement-learning enhanced reasoning, navigation guidance, and visual question answering.

解决的问题

Alpamayo 1.5 旨在弥合自动驾驶中高层推理与具体行动预测之间的差距,尤其适用于“长尾”(罕见或复杂)场景。它为构建端到端驾驶骨干网络或基于推理的自动标注工具提供了基础。

工作原理

该系统采用包含 Cosmos-Reason 主干和扩散专家的视觉-语言-动作(VLA)架构。流程遵循两步式管道:

  1. 推理:视觉-语言模型(VLM)生成“因果链”推理轨迹。
  2. 行动:扩散专家基于 VLM 的隐藏状态,生成轨迹预测(6.4秒预测范围,10Hz下64个航点)。

Alpamayo 1.5 已通过强化学习(RL)进行后训练,以提升其推理与生成轨迹之间的对齐度。

适用对象

需要预训练推理模型来构建定制化驾驶应用、开展科学研究或进行基准测试的自动驾驶(AV)领域研究人员和开发者。

主要亮点

  • 交互式且可调控:支持显式导航引导和可变数量的输入摄像头。
  • 多模态能力:既能进行轨迹预测,也能执行通用视觉问答(VQA)。
  • 强化学习后训练:相比原始 Alpamayo 1,推理质量与轨迹对齐度均有提升。
  • 硬件优化:包含可选的 CUDA 图加速,以减少扩散专家启动开销。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目