vLLM 对 NVIDIA Nemotron 3 Super 的支持

vLLM 现在支持 NVIDIA Nemotron 3 Super,这是一款专为复杂多代理 AI 应用设计的开放混合专家混合(Mixture-of-Experts,MoE)模型。此集成使开发者能够部署一种在高智能与大规模代理系统所需计算效率之间取得平衡的模型。

面向多代理 AI 的高效架构

Nemotron 3 Super 采用混合 Transformer-Mamba 架构和专家混合(MoE)设计,以最小化与代理工作流相关的“思考成本”和上下文开销。

关键技术规格

  • 模型参数: 总计 1200 亿参数,推理时仅激活 120 亿参数。
  • 上下文窗口: 支持最高 100 万 token,降低目标漂移并解决多代理系统中因重复历史和工具输出导致的“上下文爆炸”问题。
  • 吞吐量: 相比传统大模型提升最高 4 倍吞吐量,相比之前的 Nemotron Super 模型提升最高 5 倍。
  • 多 Token 预测(MTP): 通过在单次前向传播中同时预测多个未来 token,加速长文本生成。
  • 潜在 MoE: 以单个专家的推理成本激活四个专家。
  • 思考预算: 通过控制推理 token 的生成量,实现最佳准确性。

性能与开放性

Nemotron 3 Super 在人工分析智能指数和开放性指数上定位为领先的开放模型。它完全开放,提供开放权重、数据集和配方,以便在私有基础设施上进行定制和安全部署。

根据人工分析基准测试,该模型在同尺寸类别中实现领先的准确率——比之前的 Nemotron Super 模型高出最高 2 倍——同时相较于其他同尺寸的开放模型保持高效。

使用 vLLM 部署

vLLM 支持在多种精度格式(包括 BF16、FP8 和 NVFP4)下对 Nemotron 3 Super 进行优化推理。在 Blackwell GPU 上,NVFP4 的吞吐量比 H100 上的 FP8 高出 4 倍,同时保持准确性。

硬件支持

支持的 GPU 包括:

  • NVIDIA B200
  • NVIDIA H100
  • DGX Spark
  • RTX 6000

快速入门实现

要使用 vLLM(版本 0.17.1)提供模型服务,可通过 OpenAI 兼容的 API 使用以下命令配置 4x H100 环境:

# BF16
vllm serve nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 \
    --kv-cache-dtype fp8 \
    --tensor-parallel-size 4 \
    --trust-remote-code \
    --served-model-name nemotron \
    --enable-auto-tool-choice \
    --tool-call-parser qwen3_coder \
    --reasoning-parser nemotron_v3

服务器启动后,可使用 OpenAI Python 客户端对模型进行提示,在响应中获取 reasoning_content 和最终的 content

Sources