NVIDIA Nemotron 3.5 Lightning 和 NeMo Switchyard 发布

NVIDIA Nemotron 3.5 Lightning 和 NeMo Switchyard 优化智能体 AI 工作流

NVIDIA 发布了 Nemotron 3.5 Lightning 和 NeMo Switchyard,以实现“模型系统”的部署,其中专门的、高效的模型处理特定任务,而前沿模型负责编排。这种架构在不牺牲复杂、长时间运行的智能体 AI 工作负载所需的智能的情况下,降低了运营成本和延迟。

Nemotron 3.5 Lightning:高效专业执行

Nemotron 3.5 Lightning 是一个拥有 300 亿参数的混合专家 (MoE) 开源模型,旨在用于多智能体系统中的高容量专业任务。它针对代码审查、工具使用、安全警报监控和特定领域查询等任务进行了优化。

性能与定制化

Nemotron 3.5 Lightning 与同类其他模型相比,可提供高达 4 倍的输出速度和 30% 更快的智能体任务完成速度。由于它是一个开源模型,组织可以使用 NVIDIA NeMo 在专有领域数据上对其进行后训练,以提高特定行业工作流的准确性。

部署灵活性

该模型旨在在各种硬件环境中运行,以最大限度地提高基础设施投资并确保数据隐私:

  • Local AI Systems: NVIDIA RTX PCs, DGX Spark, DGX Station, and Jetson.
  • Enterprise Infrastructure: RTX PRO workstations, data centers, and cloud environments.

为了支持透明度和进一步开发,NVIDIA 发布了 Nemotron-RL-Agentic-Terminal-Pivot 数据集,该数据集被用于针对编码智能体能力的模型后训练。

NeMo Switchyard:智能模型路由

NeMo Switchyard 是一个开源库,实现了 AI 智能体的智能路由。它会根据工作流中特定步骤的要求,自动将提示词引导至最合适的模型——无论是开源模型、专有模型还是 NVIDIA 特有的模型。

效率提升与 Token 经济学

通过将请求路由到最高效的模型,而不是依赖单一的前沿模型处理所有任务,企业可以显著改善其“tokenomics”。内部基准测试表明,NeMo Switchyard 在保持前沿模型水平的准确性时,将任务完成成本降低至仅约为使用 Opus 4.8 的成本的三分之一。

生态系统集成与合作伙伴结果

多家合作伙伴已集成 NeMo Switchyard 以优化其 AI 技术栈:

  • LangChain: 报告称,通过仅将 7% 的调用路由至前沿模型,在多轮 Deep Agents 任务中实现了 74% 的成本降低,准确率仅牺牲了 6%。
  • Ramp: 在 Ramp SWE-Bench 中降低了 58% 的成本和 33% 的运行时间。
  • Cognition: 在 FrontierCode Main 上,相对于单一前沿模型,将平均成本降低了 28%,同时保持了接近前沿模型的性能。
  • Boomi: 实现了 100% 的领域路由准确率,并将后续轮次的延迟降低了 21%。
  • Kong: 现在通过 Kong AI Gateway 提供路由功能。

技术社区观点

虽然 NVIDIA 强调 Nemotron 3.5 Lightning 的效率,但 Hacker News 上的技术讨论揭示了对性能感知的差异,特别是在涉及复杂编码任务的混合专家 (MoE) 架构方面。

MoE 与 稠密模型 (Dense Models)

一些开发者报告称,虽然像 Nemotron 3.5 Lightning 和 Qwen 3.6-35B 这样的 MoE 模型非常快,但与同等规模的稠密模型相比,它们在处理复杂、多步逻辑时可能会遇到困难。

"I'm finding that the Mixture-of-Experts (MoE) models (Qwen 3.6-35B, and Nemotron 3.5 Lightning) are, well, terrible at this [building a collaborative whiteboard]. They just couldn't get the job done at all... Whereas ~30B dense models (not MoE) are pretty decent."

硬件与可访问性

用户注意到该模型在不同平台上的灵活性,有报告称其通过 MLX 在 Apple Silicon 上成功运行,不过也有人提醒,在旧硬件上性能可能会变慢。此外,社区对于更小规模的 MoE 模型(例如 12B)的需求也在持续,以更好地适应具有 16GB VRAM 限制的用户。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch