NVIDIA Nemotron 3.5 Lightning 发布
NVIDIA Nemotron 3.5 Lightning 现已在 Ollama 上可用,支持部署专为本地智能体工作流(agentic workflows)设计的 300 亿参数开源模型。该模型针对多步任务(如工具调用和上下文收集)进行了优化,允许开发者在本地硬件上运行高性能智能体,以确保数据隐私并降低延迟。
模型架构与技术规格
Nemotron 3.5 Lightning 采用混合专家(MoE)架构,总参数量为 300 亿,但每个 token 的激活参数仅为 30 亿。这种设计使模型能够在保持大模型能力的同时,依然能够高效地在本地系统(包括 NVIDIA RTX PC、RTX PRO 工作站、DGX Spark 和 DGX Station)以及云环境中运行。
关键技术规格包括:
- 上下文窗口: 上下文长度高达 100 万 token,为多轮工作流中广泛的工具历史记录提供了充足的空间。
- 推理优化: 该模型通过多 token 预测(MTP)、DFlash 或 DSpark 采用投机解码(speculative decoding),与同类开源模型相比,吞吐量最高可提升 4 倍。
- 定制化: 作为在开源数据集上训练的开源模型,Nemotron 3.5 Lightning 支持针对特定任务进行训练后处理(post-training)。
智能体能力与使用场景
Nemotron 3.5 Lightning 专门针对智能体框架(agent harnesses)进行了训练,专注于编码、工具调用、指令遵循和多轮工作。它针对需要智能体保持活跃以执行顺序操作(如读取文件、调用工具和重试失败步骤)的工作负载进行了优化。
主要使用场景包括:
- 本地个人助手: 使用本地上下文管理电子邮件、日历和预订,而无需将数据传输到外部。
- 编码子智能体: 在现有的开发者框架内执行测试、搜索代码库并应用重构。
- uma Security Operations: 丰富警报信息、对事件进行分类、查询日志并为分析师准备结构化结果。
- 混合云层级: 作为本地层级处理高吞吐量步骤,同时通过相同的 CLI 和 API 将复杂任务路由到更大的托管模型。
- 专业化本地模型: 作为针对特定领域任务进行训练后处理的基础模型,用于本地执行。
性能基准测试
Nemotron 3.5 Lightning 在与同等规模的领先开源模型相比时,展现出了显著的效率提升。它提供了 4 倍的吞吐量并缩短了 30% 的任务完成时间。根据 NVIDIA 的说法,更高的吞吐量对于长时间运行的智能体至关重要,因为它增加了每分钟完成的步骤数,从而减少了完成复杂任务所需的总时间。该模型在推理、编码和智能体任务方面也保持了领先的准确度。
通过 Ollama 部署
Nemotron 3.5 Lightning 可以使用 Ollama 进行本地部署。对于 Apple silicon 用户,提供了一个专门的版本(nemotron-3.5-lightning:30b-mlx)以实现优化性能。
用户可以通过通用聊天或使用 ollama launch 命令将其与 Claude Code、OpenClaw、Hermes Agent 和 OpenCode 等各种工具集成。
Sources
- OriginalNVIDIA Nemotron 3.5 Lightning
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch