vLLM 对 NVIDIA Nemotron 3.5 Lightning 的 Day-0 支持

TL;DR

NVIDIA 宣布在 vLLM 推理引擎上实现对 300 亿参数 Nemotron 3.5 Lightning 模型的 Day-0 支持。通过混合专家混合(MoE)设计和三种投机解码方法(Multi-Token Prediction, DFlash, DSpark),为全天候运行的智能体提供高达 4 倍的吞吐量提升。


为什么 Nemotron 3.5 Lightning 对智能体工作负载至关重要

Nemotron 3.5 Lightning 针对现代智能体流水线中的“第二梯队”角色而设计:作为一个轻量级模型,它负责处理频繁且范围明确的步骤,而大型前沿模型则负责高层规划。其混合 MoE 架构在每个 token 时仅激活 3B 的总参数量(共 30B),从而降低了每个 token 的计算量,并实现了 1M token 的上下文窗口。结合多 token 预测技术,该模型提供的吞吐量比同规模的开源模型高出高达 4 倍,使其在数据中心、云端或边缘环境中的高吞吐量、全天候智能体应用中具有极高的经济可行性。


核心技术规格

特性 详情
架构 混合专家混合 (MoE),总参数量 30B,每个 token 激活 3B
上下文长度 高达 100 万 token
模态 文本输入 → 文本输出
投机解码 Multi-Token Prediction (MTP), DFlash, DSpark
推理控制 支持按请求启用/禁用,并具有可配置的推理 token 预算
训练血统 从 NVIDIA Nemotron 3 Ultra 蒸馏而来;在流行的智能体框架上进行了微调
定制化 开源模型;支持在特定领域数据上进行后训练
发布时的精度格式 BF16 和 NVFP4
支持的硬件 NVIDIA DGX Spark, DGX Station, RTX PRO/RTX, Jetson, H100, H200, A100, L40S, B200/GB200, B300/GB300

使用 vLLM 开始使用

安装 vLLM 容器

docker pull vllm/vllm-openai:v0.27.1

docker run --rm -it \
  --gpus all \
  --ipc=host \
  --network=host \
  --entrypoint /bin/bash \
  vllm/vllm-openai:v0.27.1

部署 Nemotron 3.5 Lightning(示例:1× H100)

vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 \
  --max-num-seqs 256 \
  --max-num-batched-tokens 32768 \
  --enable-prefix-caching \
  --async-scheduling \
  --mamba-backend flashinfer \
  --moe-backend humming \
  --linear-backend humming \
  --mamba-ssu-algorithm horizontal \
  --mamba-cache-mode align \
  --mamba-ssm-cache-dtype float16 \
  --enable-mamba-cache-stochastic-rounding \
  --mamba-cache-philox-rounds 5 \
  --reasoning-parser nemotron_v3 \
  --tool-call-parser qwen3_coder \
  --enable-auto-tool-choice \
  --host 0.0.0.0 \
  --port 8000

OpenAI 兼容客户端调用示例

from openai import OpenAI

client = OpenAI(base_url="http://127.0.0.1:8000/v1", api_key="null")

resp = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Briefly explain: what is vLLM?"},
    ],
    temperature=1.0,
    top_p=0.95,
    max_tokens=1024,
)

choice = resp.choices[0]
print("Reasoning:", choice.message.reasoning)
print("Content:", choice.message.content)

投机解码技术

Multi-Token Prediction (MTP)

MTP 增加了轻量级的预测头,用于提议一小块未来的 token。目标模型验证该块,从而减少顺序步骤的数量。

vllm serve... \
  --speculative_config.method mtp \
  --speculative_config.num_speculative_tokens 3

DFlash

DFlash 使用专门的扩散草案模型(diffusion draft model)来并行生成整个候选块。它需要一个单独的草案检查点(draft checkpoint)。

vllm serve... \
  --speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash \
  --speculative_config.num_speculative_tokens 3

Draft checkpoint: nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash.

DSpark

DSpark 融合了自回归和扩散式草案生成,在 MTP 和 DFlash 之间提供了折中方案。它在 DGX Spark 上提供了最佳的延迟-吞吐量权衡。

vllm serve... \
  --speculative_config.method dspark \
  --speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark \
  --speculative_config.num_speculative_tokens 3

Draft checkpoint: nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark.


对 vLLM 上游的性能贡献

  • 将 DSpark 投机器集成到 Nemotron 模型定义中。
  • 将 DSpark 草案头量化为 W4A16,降低了内存占用和延迟。
  • 移除了草案-验证循环中的主机-设备同步,并启用了异步调度。
  • 为 MoE 和密集层将默认的 Marlin 后端替换为针对 Hopper 优化的 Humming 后端,带来了约 20% 的吞吐量增益。
  • 为 Mamba2 状态空间层添加了 ReplaySSM 支持,减少了循环路径开버。

特定硬件部署指南

DGX Spark (单用户)

vllm serve... \
  --max-num-batched-tokens 16384 \
  --compilation_config.cudagraph_capture_sizes '[1,2,4,8,16,24,32,40,48,56,64,72,80,88,96,104,112,120,128,136,144,152,160,168,176,184,192,200,208,216,224,232,240,248,256,1024,2048,4096,8192]' \
  --speculative_config.method dspark \
  --speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark

Pareto chart of inference performance on DGX Spark

NVIDIA H100 (单用户)

vllm serve... \
  --moe-backend humming \
  --linear-backend humming \
  --max-num-seqs 256 \
  --max-num-batched-tokens 32768 \
  --async-scheduling

Pareto chart of inference performance on H100 GPUs

NVIDIA Jetson (边缘)

vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \
  --reasoning-parser nemotron_v3 \
  --kv-cache-dtype fp8 \
  --trust-remote-code \
  --max-num-batched-tokens 16384 \
  --enable-prefix-caching \
  --mamba-backend flashinfer \
  --mamba-ssm-cache-dtype float16 \
  --enable-mamba-cache-stochastic-rounding \
  --mamba-cache-philox-rounds 5 \
  --mamba-cache-mode align

准确率与效率前沿

Nemotron 3.5 Lightning 继承了 Nemotron 3 Ultra 的能力,并在以智能体为中心的数据集上进行了微调。基准测试 (PinchBench) 显示,该模型在完成 10,000 个任务时,准确率可与 Qwen 3.6 35B 等大型模型相媲美,同时速度快了高达 30%Efficiency frontier line chart


如何获取模型


与 Nemotron 3 Nano 的比较

Nemotron 3 Nano 引入了混合 Mamba-Transformer MoE 设计。Nemotron 3.5 Lightning 通过以下方式对其进行了扩展:

  1. 从 Nemotron 3 Ultra 蒸馏前沿模型能力。
  2. 优化了针对智能体框架和多轮工作流的训练。
  3. 增加了三种投机解码路径 (MTP, DFlash, DSpark) 以加速生成。 其最终效果是在智能体任务上实现了更高的准确率,并实现了高达 4 倍的吞吐量提升。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch