NVIDIA Nemotron 3.5 Lightning 在 vLLM 上的首日支援

TL;DR

NVIDIA 宣布在 vLLM 推理引擎上對 300 億參數的 Nemotron 3.5 Lightning 模型提供首日支援,透過混合專家模型 (MoE) 設計與三種投機解碼方法(Multi-Token Prediction、DFlash、DSpark),為全天候運行的代理程式 (agents) 提供高達 4 倍的吞吐量。


為什麼 Nemotron 3.5 Lightning 對於代理工作負載至關重要

Nemotron 3.5 Lightning 針對現代代理流水線中的「第二梯隊」角色進行了優化:這是一個輕量級模型,負責處理頻繁且範圍明確的步驟,而大型前沿模型則負責高層次的規劃。其混合 MoE 架構在每個 token 僅激活總共 30B 參數中的 3B,降低了每個 token 的計算量,並實現了 1M token 的上下文窗口。結合多 token 預測技術,該模型提供的吞吐量比同尺寸的開源模型高出高達 4 倍,使其在數據中心、雲端或邊緣環境中,對於高吞吐量的全天候代理程式而言具有經濟可行性。


核心技術規格

特性 詳細資訊
架構 混合專家模型 (MoE),總參數 30B,每個 token 激活 3B
上下文長度 高達 100 萬 tokens
模態 文本輸入 → 文本輸出
投機解碼 Multi-Token Prediction (MTP), DFlash, DSpark
推理控制 可針對每個請求啟用/禁用,並具備可配置的推理 token 預算
訓練血統 蒸餾自 NVIDIA Nemotron 3 Ultra;已針對流行的代理框架進行微調
定制化 開源模型;支援在特定領域數據上進行後訓練
發布時的精度格式 BF16 與 NVFP4
支援硬體 NVIDIA DGX Spark, DGX Station, RTX PRO/RTX, Jetson, H100, H200, A100, L40S, B200/GB200, B300/GB300

使用 vLLM 開始使用

安裝 vLLM 容器

docker pull vllm/vllm-openai:v0.27.1

docker run --rm -it \
  --gpus all \
  --ipc=host \
  --network=host \
  --entrypoint /bin/bash \
  vllm/vllm-openai:v0.27.1

部署 Nemotron 3.5 Lightning (範例:1× H100)

vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 \
  --max-num-seqs 256 \
  --max-num-batched-tokens 32768 \
  --enable-prefix-caching \
  --async-scheduling \
  --mamba-backend flashinfer \
  --moe-backend humming \
  --linear-backend humming \
  --mamba-ssu-algorithm horizontal \
  --mamba-cache-mode align \
  --mamba-ssm-cache-dtype float16 \
  --enable-mamba-cache-stochastic-rounding \
  --mamba-cache-philox-rounds 5 \
  --reasoning-parser nemotron_v3 \
  --tool-call-parser qwen3_coder \
  --enable-auto-tool-choice \
  --host 0.0.0.0 \
  --port 8000

OpenAI 相容客戶端調用範例

from openai import OpenAI

client = OpenAI(base_url="http://127.0.0.1:8000/v1", api_key="null")

resp = client.chat.completions.create(
    model="nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Briefly explain: what is vLLM?"},
    ],
    temperature=1.0,
    top_p=0.95,
    max_tokens=1024,
)

choice = resp.choices[0]
print("Reasoning:", choice.message.reasoning)
print("Content:", choice.message.content)

投機解碼技術

Multi-Token Prediction (MTP)

MTP 增加了輕量級的預測頭,用於提議一小塊未來的 tokens。目標模型會驗證該區塊,從而減少序列步驟的數量。

vllm serve... \
  --speculative_config.method mtp \
  --speculative_config.num_speculative_tokens 3

DFlash

DFlash 使用專用的擴散草稿模型 (diffusion draft model) 來並行生成整個候選區塊。它需要一個獨立的草稿檢查點 (draft checkpoint)。

vllm serve... \
  --speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash \
  --speculative_config.num_speculative_tokens 3

草稿檢查點: nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash

DSpark

DSpark 融合了自回歸 (autoregressive) 與擴散式草稿風格,在 MTP 與 DFlash 之間提供了一個折衷方案。它在 DGX Spark 上提供了最佳的延遲與吞吐量權衡。

vllm serve... \
  --speculative_config.method dspark \
  --speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark \
  --speculative_config.num_speculative_tokens 3

草稿檢查點: nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark


對 vLLM 上游的性能貢獻

  • 將 DSpark 投機器整合進 Nemotron 模型定義中。
  • 將 DSpark 草稿頭量化為 W4A16,降低了記憶體使用與延遲。
  • 移除了草稿與驗證循環中的主機與設備間的同步 (host-device syncs),並啟用了非同步調度。
  • 將預設的 Marlin backend 替換為針對 Hopper 優化的 Humming backend(用於 MoE 與 dense 層),帶來了約 20% 的吞吐量增益。
  • 為 Mamba2 狀態空間層增加了 ReplaySSM 支援,減少了遞迴路徑的開銷。

硬體特定部署指南

DGX Spark (單用戶)

vllm serve... \
  --max-num-batched-tokens 16384 \
  --compilation_config.cudagraph_capture_sizes '[1,2,4,8,16,24,32,40,48,56,64,72,80,88,96,104,112,120,128,136,144,152,160,168,176,184,192,200,208,216,224,232,240,248,256,1024,2048,4096,8192]' \
  --speculative_config.method dspark \
  --speculative_config.model nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark

Pareto chart of inference performance on DGX Spark

NVIDIA H100 (單用戶)

vllm serve... \
  --moe-backend humming \
  --linear-backend humming \
  --max-num-seqs 256 \
  --max-num-batched-tokens 32768 \
  --async-scheduling

Pareto chart of inference performance on H100 GPUs

NVIDIA Jetson (邊緣端)

vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \
  --reasoning-parser nemotron_v3 \
  --kv-cache-dtype fp8 \
  --trust-remote-code \
  --max-num-batched-tokens 16384 \
  --enable-prefix-caching \
  --mamba-backend flashinfer \
  --mamba-ssm-cache-dtype float16 \
  --enable-mamba-cache-stochastic-rounding \
  --mamba-cache-philox-rounds 5 \
  --mamba-cache-mode align

準確度與效率前沿

Nemotron 3.5 Lightning 繼承了 Nemotron 3 Ultra 的能力,並針對以代理為中心的數據集進行了微調。基準測試 (PinchBench) 顯示,該模型在完成 10,000 個任務時,準確度可與 Qwen 3.6 35B 等較大型模型媲美,同時速度快了高達 30%Efficiency frontier line chart


如何獲取模型


與 Nemotron 3 Nano 的比較

Nemotron 3 Nano 引入了混合 Mamba-Transformer MoE 設計。Nemotron 3.5 Lightning 透過以下方式對其進行擴展:

  1. 從 Nemotron 3 Ultra 蒸餾前沿模型能力。
  2. 優化針對代理框架與多輪工作流的訓練。
  3. 增加三種投機解碼路徑 (MTP, DFlash, DSpark) 以加速生成。 其最終效果是在代理任務上獲得更高的準確度,並實現高達 4 倍的吞吐量提升。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch