NVIDIA Nemotron 3.5 Lightning 與 NeMo Switchyard 發佈
NVIDIA Nemotron 3.5 Lightning 與 NeMo Switchyard 優化代理型 AI 工作流
NVIDIA 已發佈 Nemotron 3.5 Lightning 與 NeMo Switchyard,以實現「模型系統」的部署,其中專業且高效的模型處理特定任務,而前沿模型(frontier models)則負責編排。這種架構在不犧牲複雜、長期運行的代理型 AI 工作負載所需智能的情況下,降低了營運成本與延遲。
Nemotron 3.5 Lightning:高效專業執行
Nemotron 3.5 Lightning 是一款擁有 300 億參數的混合專家(MoE)開源模型,專為多代理系統中的高容量專業任務而設計。它針對程式碼審查、工具使用、安全警報監控以及特定領域查詢等任務進行了優化。
效能與自定義
Nemotron 3.5 Lightning 與同類型的其他模型相比,提供高達 4 倍的輸出速度,且代理型任務完成速度快了 30%。由於它是一款開源模型,企業可以利用 NVIDIA NeMo 在專有領域數據上對其進行後訓練(post-train),以提高特定行業工作流的準確度。
部署靈活性
該模型設計用於在各種硬體環境中運行,以最大化基礎設施投資並確保數據隱私:
- 本地 AI 系統: NVIDIA RTX PC、DGX Spark、DGX Station 與 Jetson。
- 企業級基礎設施: RTX PRO 工作站、數據中心與雲端環境。
為了支持透明度與進一步開發,NVIDIA 已發佈 Nemotron-RL-Agentic-Terminal-Pivot 數據集,該數據集曾用於對模型進行程式碼代理能力(coding agent capabilities)的後訓練。
NeMo Switchyard:智能模型路由
NeMo Switchyard 是一款實現 AI 代理智能路由的開源函式庫。它會根據工作流中特定步驟的需求,自動將提示詞(prompts)導向最合適的模型——無論是開源模型、專有模型還是 NVIDIA 特有的模型。
效率提升與 Tokenomics
透過將請求路由至最高效的模型,而非依賴單一的前沿模型處理所有任務,企業可以顯著改善其「Tokenomics」(代幣經濟學)。內部基準測試顯示,NeMo Switchyard 在保持前沿級別準確度的同時,將任務完成成本降低至僅約使用 Opus 4.8 的三分之一。
生態系統整合與合作夥伴成果
多個合作夥伴已整合 NeMo Switchyard 以優化其 AI 技術棧:
- LangChain: 報告稱,透過僅將 7% 的調用路由至前沿模型,多輪對話深度代理(Deep Agents)任務的成本降低了 74%,準確度僅犧牲了 6%。
- Ramp: 在 Ramp SWE-Bench 中降低了 58% 的成本與 33% 的運行時間。
- Cognition: 相對於單一前沿模型,在 FrontierCode Main 上降低了 28% 的平均成本,同時保持了接近前沿模型的性能。
- Boomi: 實現了 100% 的領域路由準確度,並將後續輪次的延遲降低了 21%。
- Kong: 現在透過 Kong AI Gateway 提供路由功能。
技術社群觀點
雖然 NVIDIA 強調 Nemotron 3.5 Lightning 的效率,但 Hacker News 上的技術討論揭示了對性能感知的分歧,特別是關於用於複雜程式碼任務的混合專家(MoE)架構。
MoE 與 Dense 模型
一些開發者報告稱,雖然像 Nemotron 3.5 Lightning 與 Qwen 3.6-35B 這樣的 MoE 模型速度極快,但與同等規模的 Dense 模型相比,在處理複雜、多步驟邏輯時可能會遇到困難。
硬體與可及性
用戶已注意到該模型在不同平台上的靈活性,有報告稱其在 Apple Silicon 上透過 MLX 成功執行,儘管也有人提醒性能可能在舊硬體上較慢。社群對於更小規模的 MoE 模型(例如 12B)仍有持續需求,以更好地適應具有 16GB VRAM 限制的用戶。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch