NVIDIA Nemotron 3 Ultra 在 vLLM 上的支持
NVIDIA Nemotron 3 Ultra 在 vLLM 上的支持
vLLM 已宣布对 NVIDIA Nemotron 3 Ultra 提供 Day-0 支持,这是一种专门为长时间运行的自主代理工作流程设计的前沿级推理模型。此集成使开发者能够使用 OpenAI 兼容的 API 部署高吞吐量、具代理能力的 AI 系统,能够进行复杂的编排、编码和深度研究。
Nemotron 3 Ultra 技术规格
Nemotron 3 Ultra 是一种开放权重模型,旨在保持推理深度同时确保推理速度,以便在持续的代理系统中实际部署。
- 架构: 使用混合 Transformer-Mamba 架构的 Mixture of Experts (MoE)。
- 参数数量: 总共 550B 参数,其中活跃参数为 55B。
- 上下文窗口: 支持最多 1M 个标记。
- 模态: 文本输入和文本输出。
- 精度支持: 通过 NVFP4 和 BF16 实现高吞吐量推理。
- 硬件兼容性:
- BF16: 支持 8x GB200/B200/GB300/B300、16x H100 或 8x H200 GPU。
- NVFP4: 支持 4x GB200/B200/GB300/B300 或 8x H100 GPU(NVFP4 检查点专门适用于 Blackwell GPU)。
代理推理的架构创新
为了在高容量推理中平衡效率和准确性,Nemotron 3 Ultra 实施了几项架构进步:
混合 Mamba-Transformer 层
将 Mamba 层用于长上下文工作负载的序列效率,与 Transformer 层结合以确保从大上下文窗口中精确召回特定事实。
潜在 MoE 和多标记预测 (MTP)
潜在 MoE 使得在代码生成和工具调用等多样化任务中能够更高效地进行专家路由。多标记预测 (MTP) 通过在单次前向传递中预测多个未来标记来减少生成时间,从而提高多轮工作流程的吞吐量。
代理特定的后训练
该模型在各种代理套件上使用 NVIDIA NeMo RL 和 Gym 进行后训练。此优化侧重于多轮工作流程,在这些工作流程中,代理必须进行规划、调用工具、读取观察结果、委派给子代理并从错误中恢复,而不是简单的单轮聊天。
性能和成本效率
Nemotron 3 Ultra 在开放模型中被定位为代理生产力、指令遵循和长上下文任务的领导者。根据来源材料,该模型提供领先的吞吐量,并相比其他领先的开放模型将成本降低多达 30%。
使用 vLLM 部署
vLLM 作为 Nemotron 3 Ultra 训练工作流的关键组件,为 rollouts 和模型评估提供高吞吐量多节点推理。它目前在 NeMo RL 中充当强化学习 rollouts 的生成后端,并与 NeMo Gym 集成以支持多步训练环境。
提供模型服务
开发者可以通过 vLLM 使用 OpenAI 兼容的 API 来提供 Nemotron 3 Ultra 服务。对于 8x B200 设置,典型配置包括以下标志:
--tensor-parallel-size 8--kv-cache-dtype fp8--speculative_config.method mtp(利用多标记预测)--reasoning-parser nemotron_v3--tool-call-parser qwen3_coder
模型权重在 Hugging Face 上提供 BF16 和 NVFP4 两种格式。