vLLM 对 NVIDIA Nemotron 3.5 Lightning 的 Day-0 支持
TL;DR
NVIDIA 宣布在 vLLM 推理引擎上实现对 300 亿参数 Nemotron 3.5 Lightning 模型的 Day-0 支持。通过混合专家混合(MoE)设计和三种投机解码方法(Multi-Token Prediction, DFlash, DSpark),为全天候运行的智能体提供高达 4 倍的吞吐量提升。
为什么 Nemotron 3.5 Lightning 对智能体工作负载至关重要
Nemotron 3.5 Lightning 针对现代智能体流水线中的“第二梯队”角色而设计:作为一个轻量级模型,它负责处理频繁且范围明确的步骤,而大型前沿模型则负责高层规划。其混合 MoE 架构在每个 token 时仅激活 3B 的总参数量(共 30B),从而降低了每个 token 的计算量,并实现了 1M token 的上下文窗口。结合多 token 预测技术,该模型提供的吞吐量比同规模的开源模型高出高达 4 倍,使其在数据中心、云端或边缘环境中的高吞吐量、全天候智能体应用中具有极高的经济可行性。
核心技术规格
| 特性 | 详情 |
|---|---|
| 架构 | 混合专家混合 (MoE),总参数量 30B,每个 token 激活 3B |
| 上下文长度 | 高达 100 万 token |
| 模态 | 文本输入 → 文本输出 |
| 投机解码 | Multi-Token Prediction (MTP), DFlash, DSpark |
| 推理控制 | 支持按请求启用/禁用,并具有可配置的推理 token 预算 |
| 训练血统 | 从 NVIDIA Nemotron 3 Ultra 蒸馏而来;在流行的智能体框架上进行了微调 |
| 定制化 | 开源模型;支持在特定领域数据上进行后训练 |
| 发布时的精度格式 | BF16 和 NVFP4 |
| 支持的硬件 | NVIDIA DGX Spark, DGX Station, RTX PRO/RTX, Jetson, H100, H200, A100, L40S, B200/GB200, B300/GB300 |
使用 vLLM 开始使用
安装 vLLM 容器
docker pull vllm/vllm-openai:v0.27.1
docker run --rm -it \
--gpus all \
--ipc=host \
--network=host \
--entrypoint /bin/bash \
vllm/vllm-openai:v0.27.1
部署 Nemotron 3.5 Lightning(示例:1× H100)
vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 \
--max-num-seqs 256 \
--max-num-batched-tokens 32768 \
--enable-prefix-caching \
--async-scheduling \
--mamba-backend flashinfer \
--moe-backend humming \
--linear-backend humming \
--mamba-ssu-algorithm horizontal \
--mamba-cache-mode align \
--mamba-ssm-cache-dtype float16 \
--enable-mamba-cache-stochastic-rounding \
--mamba-cache-philox-rounds 5 \
--reasoning-parser nemotron_v3 \
--tool-call-parser qwen3_coder \
--enable-auto-tool-choice \
--host 0.0.0.0 \
--port 8000
OpenAI 兼容客户端调用示例
from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:8000/v1", api_key="null")
resp = client.chat.completions.create(
model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Briefly explain: what is vLLM?"},
],
temperature=1.0,
top_p=0.95,
max_tokens=1024,
)
choice = resp.choices[0]
print("Reasoning:", choice.message.reasoning)
print("Content:", choice.message.content)
投机解码技术
Multi-Token Prediction (MTP)
MTP 增加了轻量级的预测头,用于提议一小块未来的 token。目标模型验证该块,从而减少顺序步骤的数量。
vllm serve... \
--speculative_config.method mtp \
--speculative_config.num_speculative_tokens 3
DFlash
DFlash 使用专门的扩散草案模型(diffusion draft model)来并行生成整个候选块。它需要一个单独的草案检查点(draft checkpoint)。
vllm serve... \
--speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash \
--speculative_config.num_speculative_tokens 3
Draft checkpoint: nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash.
DSpark
DSpark 融合了自回归和扩散式草案生成,在 MTP 和 DFlash 之间提供了折中方案。它在 DGX Spark 上提供了最佳的延迟-吞吐量权衡。
vllm serve... \
--speculative_config.method dspark \
--speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark \
--speculative_config.num_speculative_tokens 3
Draft checkpoint: nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark.
对 vLLM 上游的性能贡献
- 将 DSpark 投机器集成到 Nemotron 模型定义中。
- 将 DSpark 草案头量化为 W4A16,降低了内存占用和延迟。
- 移除了草案-验证循环中的主机-设备同步,并启用了异步调度。
- 为 MoE 和密集层将默认的 Marlin 后端替换为针对 Hopper 优化的 Humming 后端,带来了约 20% 的吞吐量增益。
- 为 Mamba2 状态空间层添加了 ReplaySSM 支持,减少了循环路径开버。
特定硬件部署指南
DGX Spark (单用户)
vllm serve... \
--max-num-batched-tokens 16384 \
--compilation_config.cudagraph_capture_sizes '[1,2,4,8,16,24,32,40,48,56,64,72,80,88,96,104,112,120,128,136,144,152,160,168,176,184,192,200,208,216,224,232,240,248,256,1024,2048,4096,8192]' \
--speculative_config.method dspark \
--speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark

NVIDIA H100 (单用户)
vllm serve... \
--moe-backend humming \
--linear-backend humming \
--max-num-seqs 256 \
--max-num-batched-tokens 32768 \
--async-scheduling

NVIDIA Jetson (边缘)
vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \
--reasoning-parser nemotron_v3 \
--kv-cache-dtype fp8 \
--trust-remote-code \
--max-num-batched-tokens 16384 \
--enable-prefix-caching \
--mamba-backend flashinfer \
--mamba-ssm-cache-dtype float16 \
--enable-mamba-cache-stochastic-rounding \
--mamba-cache-philox-rounds 5 \
--mamba-cache-mode align
准确率与效率前沿
Nemotron 3.5 Lightning 继承了 Nemotron 3 Ultra 的能力,并在以智能体为中心的数据集上进行了微调。基准测试 (PinchBench) 显示,该模型在完成 10,000 个任务时,准确率可与 Qwen 3.6 35B 等大型模型相媲美,同时速度快了高达 30%。

如何获取模型
- BF16 检查点: https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16
- NVFP4 检查点: https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
- 入门笔记本: https://github.com/NVIDIA-NeMo/Nemotron/blob/main/usage-cookbook/Nemotron-3.5-Lightning/vllm_cookbook.ipynb
与 Nemotron 3 Nano 的比较
Nemotron 3 Nano 引入了混合 Mamba-Transformer MoE 设计。Nemotron 3.5 Lightning 通过以下方式对其进行了扩展:
- 从 Nemotron 3 Ultra 蒸馏前沿模型能力。
- 优化了针对智能体框架和多轮工作流的训练。
- 增加了三种投机解码路径 (MTP, DFlash, DSpark) 以加速生成。 其最终效果是在智能体任务上实现了更高的准确率,并实现了高达 4 倍的吞吐量提升。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch