NVIDIA Nemotron 3 Ultra 支援於 vLLM

NVIDIA Nemotron 3 Ultra 支援於 vLLM

vLLM 已宣布對 NVIDIA Nemotron 3 Ultra 提供 Day-0 支援,這是一種專為長時間運行的自主代理工作流程設計的前沿級推理模型。此整合使開發者能夠部署高吞吐量、具代理能力的 AI 系統,能夠透過 OpenAI 相容的 API 進行複雜的編排、編碼和深度研究。

Nemotron 3 Ultra 技術規格

Nemotron 3 Ultra 是一種開放權重模型,旨在保持推理深度同時確保推理速度,以便在持續的代理系統中進行實際部署。

  • 架構: 使用混合 Transformer-Mamba 架構的專家混合 (MoE)。
  • 參數數量: 總參數數為 550B,其中有 55B 個活躍參數。
  • 上下文窗口: 支援最多 1M 個 tokens。
  • 模態: 文字輸入和文字輸出。
  • 精度支援: 透過 NVFP4 和 BF16 進行高吞吐量推理。
  • 硬體相容性:
    • BF16: 支援於 8x GB200/B200/GB300/B300、16x H100 或 8x H200 GPU。
    • NVFP4: 支援於 4x GB200/B200/GB300/B300 或 8x H100 GPU(NVFP4 檢查點專門適用於 Blackwell GPU)。

代理推理的架構創新

為了在高容量推理中平衡效率與準確性,Nemotron 3 Ultra 實施了多項架構進步:

混合 Mamba-Transformer 層

將 Mamba 層用於長上下文工作負載的序列效率,與 Transformer 層結合,以確保從大型上下文窗口中精確回憶特定事實。

潛在 MoE 和多標記預測 (MTP)

潛在 MoE 使得在如程式碼生成和工具調用等多樣化任務中能夠更有效地進行專家路由。多標記預測 (MTP) 透過在單次前向傳遞中預測多個未來標記來減少生成時間,從而提升多輪工作流程的吞吐量。

代理特定後訓練

該模型使用 NVIDIA NeMo RL 和 Gym 在各種代理套件上進行後訓練。此優化專注於多輪工作流程,其中代理必須規劃、調用工具、讀取觀測結果、委派給子代理並從錯誤中恢復,而非簡單的單輪聊天。

效能與成本效益

Nemotron 3 Ultra 在開放模型中被定位為代理生產力、指令遵循和長上下文任務的領導者。根據來源材料,該模型提供領先的吞吐量,並相較於其他領先的開放模型將成本降低多達 30%。

使用 vLLM 部署

vLLM 作為 Nemotron 3 Ultra 訓練工作流程的關鍵組件,提供高吞吐量的多節點推理用於 rollouts 和模型評估。它目前作為 NeMo RL 內強化學習 rollouts 的生成後端,並與 NeMo Gym 整合以提供多步驟訓練環境。

提供模型服務

開發者可以透過 vLLM 使用 OpenAI 相容的 API 來提供 Nemotron 3 Ultra 服務。針對 8x B200 設置的典型配置包括以下旗標:

  • --tensor-parallel-size 8
  • --kv-cache-dtype fp8
  • --speculative_config.method mtp (利用多標記預測)
  • --reasoning-parser nemotron_v3
  • --tool-call-parser qwen3_coder

模型權重在 Hugging Face 上同時提供 BF16 和 NVFP4 格式。

Sources