NVIDIA-NeMo/Nemotron

Developer Asset Hub for NVIDIA Nemotron — A one-stop resource for training recipes, usage cookbooks, datasets, and full end-to-end reference examples to build with Nemotron models

What it solves

Nemotron 提供一系列開放、高效能的多模態模型以及完整的基礎設施,用於訓練、部署與實作。它彌補了理論模型架構與可投入生產的代理式 AI 之間的鴻溝,提供可重現的訓練配方,讓模型在程式碼撰寫、數學、科學推理與工具呼叫方面表現卓越。

How it works

此專案分為四個主要組件:

  • Nemotron Steps:一套以 CLI 為驅動的模組化建構塊(steps),涵蓋模型全生命週期,包括資料策展、合成資料生成(SDG)、預訓練、監督式微調(SFT)與強化學習(RL)。
  • Training Recipes:完整、可重現的管線,將上述步驟組合起來以建構特定模型,例如 Nemotron 3 Ultra(550B MoE)、Super(120B MoE)與 Nano(30B MoE)模型。
  • Usage Cookbooks:實務指南,說明如何在各種環境(從邊緣裝置到多 GPU 資料中心)部署模型,使用 TensorRT-LLM 與 NIM 微服務等工具。
  • Use Case Examples:端到端的代理式工作流程、RAG 系統與工具整合範例。

Who it’s for

此倉庫設計給 AI 研究者與開發者,讓他們能夠建構、微調或部署高效能的大型語言模型與多模態模型,用於代理式 AI 應用,特別是使用 NVIDIA 硬體堆疊的情境。

Highlights

  • Hybrid Architectures:使用 Mamba-Attention 與 Mixture-of-Experts(MoE)平衡推理能力與推論吞吐量。
  • Multimodal Capabilities:Nano Omni 模型原生支援文字、影像、影片與音訊於單一解碼器中。
  • Full Lifecycle Tooling:提供從原始資料準備、合成資料生成到 RLVR 與 MPO 對齊的完整工具。
  • Extensive Context:支援高達 100 萬 token 的上下文長度,適用於複雜的研究與企業工作流程。