NVIDIA Nemotron 3.5 Lightning 發佈

NVIDIA Nemotron 3.5 Lightning 現已可在 Ollama 上使用,讓部署專為本地代理工作流(agentic workflows)設計的 300 億參數開源模型成為可能。此模型針對多步驟任務(例如工具呼叫和上下文收集)進行了優化,允許開發者在本地硬體上運行高性能代理,以確保數據隱私並降低延遲。

模型架構與技術規格

Nemotron 3.5 Lightning 使用混合專家模型(Mixture-of-Experts, MoE)架構,總參數為 300 億,但每個 token 的啟動參數僅為 30 億。這種設計讓模型在保持較大模型能力的同時,仍能高效地在本地系統上運行,包括 NVIDIA RTX PC、RTX PRO 工作站、DGX Spark 和 DGX Station,以及雲端環境。

關鍵技術規格包括:

  • 上下文窗口: 上下文長度高達 100 萬個 token,為多輪工作流中大量的工具歷史紀錄提供了充足的空間。
  • 推理優化: 模型透過多 token 預測(MTP)、DFlash 或 DSpark 採用投機解碼(speculative decoding),與類似的開源模型相比,吞吐量可提升高達 4 倍。
  • 自定義: 作為在開源數據集上訓練的開源模型,Nemotron 3.5 Lightning 支援針對特定任務進行訓練後處理(post-training)。

代理能力與使用案例

Nemotron 3.5 Lightning 特別針對代理框架(agent harnesses)進行訓練,專注於編碼、工具呼叫、指令遵循和多輪工作。它針對代理必須保持活躍狀態以執行序列操作(如讀取文件、呼叫工具和重試失敗步驟)的工作負載進行了優化。

主要使用案例包括:

  • 本地個人助理: 使用本地上下文管理電子郵件、日曆和預約,而無需將數據傳輸到外部。
  • 編碼子代理: 在現有的開發者框架內執行測試、搜尋代碼庫並進行重構。
  • uma Security Operations: 豐富警報資訊、分類事件、查詢日誌並為分析師準備結構化結果。
  • 混合雲層級: 作為本地層級處理高吞吐量的步驟,同時透過相同的 CLI 和 API 將複雜任務路由至較大的託管模型。
  • 專用本地模型: 作為在特定領域任務上進行訓練後處理以進行本地執行的基礎模型。

性能基準測試

Nemotron 3.5 Lightning 在與同規模的領先開源模型相比時,展現了顯著的效率提升。它提供了 4 倍更高的吞吐量和快 30% 的任務完成時間。根據 NVIDIA 的說法,高吞吐量對於長時間運行的代理至關重要,因為它增加了每分鐘完成的步驟數量,從而減少了完成複雜任務所需的總時間。該模型在推理、編碼和代理任務方面也保持了領先的準確度。

透過 Ollama 部署

Nemotron 3.5 Lightning 可以使用 Ollama 在本地部署。對於 Apple silicon 用戶,提供了一個專用版本(nemotron-3.5-lightning:30b-mlx)以優化性能。

用戶可以透過一般聊天或使用 ollama launch 命令將其與 Claude Code、OpenClaw、Hermes Agent 和 OpenCode 等各種工具整合。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch