vLLM 中的 NVIDIA Nemotron 3 Super 支援

vLLM 現已支援 NVIDIA Nemotron 3 Super,這是一個開源的混合式 Mixture-of-Experts(MoE)模型,專為複雜的多代理 AI 應用而設計。此整合讓開發者能部署一個在高智慧與大型代理系統所需的計算效率之間取得平衡的模型。

多代理 AI 的高效能架構

Nemotron 3 Super 採用混合式 Transformer‑Mamba 架構與 Mixture-of-Experts(MoE)設計,以最小化與代理工作流程相關的「思考稅」與上下文開銷。

主要技術規格

  • 模型參數: 總計 1200 億參數,推理時僅有 120 億活躍參數。
  • 上下文窗口: 支援最高 100 萬 token,減少目標漂移,並解決多代理系統中因重複歷史與工具輸出所導致的「上下文爆炸」問題。
  • 吞吐量: 提供比傳統大型模型高出最高 4 倍的吞吐量,且較先前的 Nemotron Super 模型高出最高 5 倍。
  • 多 token 預測(MTP): 透過在單次前向傳播中同時預測多個未來 token,加速長文本生成。
  • 潛在 MoE: 使得以單一專家的推理成本即可啟用四位專家。
  • 思考預算: 透過控制推理 token 產生量,以達到最佳準確度。

效能與開放性

Nemotron 3 Super 在人工分析智慧與開放性指標上被定位為領先的開源模型。它完全開放,提供開放權重、資料集與配方,讓使用者能自訂並在私有基礎設施上安全部署。

根據人工分析基準測試,該模型在同尺寸類別中達到領先的準確度——比先前的 Nemotron Super 模型高出最高 2 倍——同時相較於其他同尺寸的開源模型保持高效能。

使用 vLLM 部署

vLLM 為 Nemotron 3 Super 提供跨多種精度格式(包括 BF16、FP8 與 NVFP4)的最佳化推理。在 Blackwell GPU 上,NVFP4 的吞吐量比 H100 上的 FP8 高出 4 倍,同時保持準確度。

硬體支援

支援的 GPU 包括:

  • NVIDIA B200
  • NVIDIA H100
  • DGX Spark
  • RTX 6000

快速開始實作

若要使用 vLLM(版本 0.17.1)提供模型服務,可透過相容 OpenAI API 的以下指令配置 4x H100 環境:

# BF16
vllm serve nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16 \
    --kv-cache-dtype fp8 \
    --tensor-parallel-size 4 \
    --trust-remote-code \
    --served-model-name nemotron \
    --enable-auto-tool-choice \
    --tool-call-parser qwen3_coder \
    --reasoning-parser nemotron_v3

伺服器啟動後,可使用 OpenAI Python 客戶端對模型發出提示,並在回應中取得 reasoning_content 與最終的 content

Sources