NVIDIA Nemotron 3 Ultra 發布

NVIDIA Nemotron 3 Ultra 是一款專為複雜且長時間運行的代理工作流程設計的開源模型,可針對涉及數百次工具呼叫的任務提供高準確性與成本效益。現已上架於 Ollama 的雲端平台,讓開發者能輕鬆整合至代理協調、程式碼代理與深度研究流程中。

模型架構與效率

Nemotron 3 Ultra 採用混合專家(MoE)架構,總參數達 5500 億,但每 token 僅有 550 億參數處於激活狀態。此設計使模型在維持頂尖推理能力的同時,大幅降低每 token 的運算負載。

為進一步優化效能與記憶體佔用,該模型針對 NVIDIA 的 4 位元浮點格式 NVFP4 進行優化。此量化技術使模型能以更少記憶體儲存,並比標準格式執行更快。

長上下文與代理功能

Nemotron 3 Ultra 特別針對跨數百步驟的代理協調與企業工作流程進行調校。主要功能包括:

  • 100 萬 token 上下文視窗: 模型可在其上下文視窗內完整保留程式碼庫、廣泛的工具使用歷史與研究脈絡,且不會失去連貫性。
  • 代理專精: 模型針對程式碼代理、深度研究與需高精度指令遵循及多工具呼叫的複雜工作流程進行優化。

性能與成本基準

根據 NVIDIA 與 Ollama 的數據,Nemotron 3 Ultra 在代理生產力、程式碼與指令遵循等基準測試中,於開源模型中表現領先,準確度最高。

在運營效率方面,該模型展現出領先的吞吐量與成本效益。與其他領先的開源模型相比,可節省高達 30% 的成本,處於成本效益前沿的最前列。

部署與整合

Nemotron 3 Ultra 可透過 Ollama 的雲端平台進行部署。支援與多種代理工具整合,包括:

  • Claude Code: ollama launch claude --model nemotron-3-ultra:cloud
  • Hermes Agent: ollama launch hermes --model nemotron-3-ultra:cloud
  • OpenClaw: ollama launch openclaw --model nemotron-3-ultra:cloud
  • 一般對話: ollama run nemotron-3-ultra:cloud

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch