NVIDIA Nemotron 3 Ultra 发布

NVIDIA Nemotron 3 Ultra 是一款专为复杂、长时运行的智能体工作流设计的开源模型,为涉及数百次工具调用的任务提供高准确性和高成本效益。它现在已在 Ollama 的云端可用,使开发者能够将其集成到智能体编排、编程智能体和深度研究流水线中。

模型架构与效率

Nemotron 3 Ultra 采用混合专家 (MoE) 架构,总参数量为 5500 亿,但每个 token 仅激活 550 亿参数。这种设计使模型能够在保持前沿推理能力的同时,降低每个 token 的计算开销。

为了进一步优化性能和内存占用,该模型针对 NVFP4(NVIDIA 的 4 位浮点格式)进行了优化。这种量化技术允许模型被压缩进更少的内存中,并比标准格式执行得更快。

长上下文与智能体能力

Nemotron 3 Ultra 专门针对跨越数百个步骤的智能体编排和企业工作流进行了微调。关键能力包括:

  • 1M Token 上下文窗口: 模型可以在其上下文窗口内保持整个代码库、广泛的工具历史记录和研究轨迹,而不会丢失连贯性。
  • 智能体专业化: 模型针对编程智能体、深度研究以及需要高精度指令遵循和多次工具调用的复杂工作流进行了优化。

性能与成本基准测试

根据 NVIDIA 和 Ollama 的说法,Nemotron 3 Ultra 在智能体生产力、编程和指令遵循基准测试的准确性方面,在开源模型中处于领先地位。

在运营效率方面,该模型展示了领先的吞吐量和成本效益。与其它领先的开源模型相比,它可节省高达 30% 的成本,使其处于成本效益前沿的最前沿。

部署与集成

Nemotron 3 Ultra 可以通过 Ollama 的云端进行部署。它支持与多种智能体工具集成,包括:

  • Claude Code: ollama launch claude --model nemotron-3-ultra:cloud
  • Hermes Agent: ollama launch hermes --model nemotron-3-ultra:cloud
  • OpenClaw: ollama launch openclaw --model nemotron-3-ultra:cloud
  • General Chat: ollama run nemotron-3-ultra:cloud

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch