NVIDIA Nemotron 3.5 Lightning 在 vLLM 上的首日支援
TL;DR
NVIDIA 宣布在 vLLM 推理引擎上對 300 億參數的 Nemotron 3.5 Lightning 模型提供首日支援,透過混合專家模型 (MoE) 設計與三種投機解碼方法(Multi-Token Prediction、DFlash、DSpark),為全天候運行的代理程式 (agents) 提供高達 4 倍的吞吐量。
為什麼 Nemotron 3.5 Lightning 對於代理工作負載至關重要
Nemotron 3.5 Lightning 針對現代代理流水線中的「第二梯隊」角色進行了優化:這是一個輕量級模型,負責處理頻繁且範圍明確的步驟,而大型前沿模型則負責高層次的規劃。其混合 MoE 架構在每個 token 僅激活總共 30B 參數中的 3B,降低了每個 token 的計算量,並實現了 1M token 的上下文窗口。結合多 token 預測技術,該模型提供的吞吐量比同尺寸的開源模型高出高達 4 倍,使其在數據中心、雲端或邊緣環境中,對於高吞吐量的全天候代理程式而言具有經濟可行性。
核心技術規格
| 特性 | 詳細資訊 |
|---|---|
| 架構 | 混合專家模型 (MoE),總參數 30B,每個 token 激活 3B |
| 上下文長度 | 高達 100 萬 tokens |
| 模態 | 文本輸入 → 文本輸出 |
| 投機解碼 | Multi-Token Prediction (MTP), DFlash, DSpark |
| 推理控制 | 可針對每個請求啟用/禁用,並具備可配置的推理 token 預算 |
| 訓練血統 | 蒸餾自 NVIDIA Nemotron 3 Ultra;已針對流行的代理框架進行微調 |
| 定制化 | 開源模型;支援在特定領域數據上進行後訓練 |
| 發布時的精度格式 | BF16 與 NVFP4 |
| 支援硬體 | NVIDIA DGX Spark, DGX Station, RTX PRO/RTX, Jetson, H100, H200, A100, L40S, B200/GB200, B300/GB300 |
使用 vLLM 開始使用
安裝 vLLM 容器
docker pull vllm/vllm-openai:v0.27.1
docker run --rm -it \
--gpus all \
--ipc=host \
--network=host \
--entrypoint /bin/bash \
vllm/vllm-openai:v0.27.1
部署 Nemotron 3.5 Lightning (範例:1× H100)
vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 \
--max-num-seqs 256 \
--max-num-batched-tokens 32768 \
--enable-prefix-caching \
--async-scheduling \
--mamba-backend flashinfer \
--moe-backend humming \
--linear-backend humming \
--mamba-ssu-algorithm horizontal \
--mamba-cache-mode align \
--mamba-ssm-cache-dtype float16 \
--enable-mamba-cache-stochastic-rounding \
--mamba-cache-philox-rounds 5 \
--reasoning-parser nemotron_v3 \
--tool-call-parser qwen3_coder \
--enable-auto-tool-choice \
--host 0.0.0.0 \
--port 8000
OpenAI 相容客戶端調用範例
from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:8000/v1", api_key="null")
resp = client.chat.completions.create(
model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Briefly explain: what is vLLM?"},
],
temperature=1.0,
top_p=0.95,
max_tokens=1024,
)
choice = resp.choices[0]
print("Reasoning:", choice.message.reasoning)
print("Content:", choice.message.content)
投機解碼技術
Multi-Token Prediction (MTP)
MTP 增加了輕量級的預測頭,用於提議一小塊未來的 tokens。目標模型會驗證該區塊,從而減少序列步驟的數量。
vllm serve... \
--speculative_config.method mtp \
--speculative_config.num_speculative_tokens 3
DFlash
DFlash 使用專用的擴散草稿模型 (diffusion draft model) 來並行生成整個候選區塊。它需要一個獨立的草稿檢查點 (draft checkpoint)。
vllm serve... \
--speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash \
--speculative_config.num_speculative_tokens 3
草稿檢查點: nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash。
DSpark
DSpark 融合了自回歸 (autoregressive) 與擴散式草稿風格,在 MTP 與 DFlash 之間提供了一個折衷方案。它在 DGX Spark 上提供了最佳的延遲與吞吐量權衡。
vllm serve... \
--speculative_config.method dspark \
--speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark \
--speculative_config.num_speculative_tokens 3
草稿檢查點: nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark。
對 vLLM 上游的性能貢獻
- 將 DSpark 投機器整合進 Nemotron 模型定義中。
- 將 DSpark 草稿頭量化為 W4A16,降低了記憶體使用與延遲。
- 移除了草稿與驗證循環中的主機與設備間的同步 (host-device syncs),並啟用了非同步調度。
- 將預設的 Marlin backend 替換為針對 Hopper 優化的 Humming backend(用於 MoE 與 dense 層),帶來了約 20% 的吞吐量增益。
- 為 Mamba2 狀態空間層增加了 ReplaySSM 支援,減少了遞迴路徑的開銷。
硬體特定部署指南
DGX Spark (單用戶)
vllm serve... \
--max-num-batched-tokens 16384 \
--compilation_config.cudagraph_capture_sizes '[1,2,4,8,16,24,32,40,48,56,64,72,80,88,96,104,112,120,128,136,144,152,160,168,176,184,192,200,208,216,224,232,240,248,256,1024,2048,4096,8192]' \
--speculative_config.method dspark \
--speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark

NVIDIA H100 (單用戶)
vllm serve... \
--moe-backend humming \
--linear-backend humming \
--max-num-seqs 256 \
--max-num-batched-tokens 32768 \
--async-scheduling

NVIDIA Jetson (邊緣端)
vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \
--reasoning-parser nemotron_v3 \
--kv-cache-dtype fp8 \
--trust-remote-code \
--max-num-batched-tokens 16384 \
--enable-prefix-caching \
--mamba-backend flashinfer \
--mamba-ssm-cache-dtype float16 \
--enable-mamba-cache-stochastic-rounding \
--mamba-cache-philox-rounds 5 \
--mamba-cache-mode align
準確度與效率前沿
Nemotron 3.5 Lightning 繼承了 Nemotron 3 Ultra 的能力,並針對以代理為中心的數據集進行了微調。基準測試 (PinchBench) 顯示,該模型在完成 10,000 個任務時,準確度可與 Qwen 3.6 35B 等較大型模型媲美,同時速度快了高達 30%。

如何獲取模型
- BF16 檢查點: https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16
- NVFP4 檢查點: https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
- 入門指南筆記本: https://github.com/NVIDIA-NeMo/Nemotron/blob/main/usage-cookbook/Nemotron-3.5-Lightning/vllm_cookbook.ipynb
與 Nemotron 3 Nano 的比較
Nemotron 3 Nano 引入了混合 Mamba-Transformer MoE 設計。Nemotron 3.5 Lightning 透過以下方式對其進行擴展:
- 從 Nemotron 3 Ultra 蒸餾前沿模型能力。
- 優化針對代理框架與多輪工作流的訓練。
- 增加三種投機解碼路徑 (MTP, DFlash, DSpark) 以加速生成。 其最終效果是在代理任務上獲得更高的準確度,並實現高達 4 倍的吞吐量提升。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch