NVIDIA-NeMo/Nemotron
Developer Asset Hub for NVIDIA Nemotron — A one-stop resource for training recipes, usage cookbooks, datasets, and full end-to-end reference examples to build with Nemotron models
What it solves
Nemotron 提供一系列开放、高效率的多模态模型以及完整的基础设施,用于训练、部署和实现它们。它弥补了理论模型架构与可投入生产的代理式 AI 之间的差距,提供可复现的训练配方,使模型在编码、数学、科学推理和工具调用方面表现出色。
How it works
项目组织为四个主要组件:
- Nemotron Steps:一个由 CLI 驱动的模块化构建块(steps)系统,覆盖整个模型生命周期,包括数据策展、合成数据生成(SDG)、预训练、监督微调(SFT)和强化学习(RL)。
- Training Recipes:完整、可复现的流水线,将这些步骤组合起来构建特定模型,如 Nemotron 3 Ultra(550B MoE)、Super(120B MoE)和 Nano(30B MoE)模型。
- Usage Cookbooks:实用指南,说明如何在各种环境(从边缘设备到多 GPU 数据中心)部署模型,使用 TensorRT-LLM 和 NIM 微服务等工具。
- Use Case Examples:端到端的代理工作流、RAG 系统和工具集成示例。
Who it’s for
此仓库面向 AI 研究者和开发者,帮助他们构建、微调或部署高性能的大语言模型和多模态模型,用于代理式 AI 应用,尤其是利用 NVIDIA 硬件栈的场景。
Highlights
- Hybrid Architectures:利用 Mamba-Attention 和 Mixture-of-Experts(MoE)在推理能力与推断吞吐量之间取得平衡。
- Multimodal Capabilities:Nano Omni 模型原生支持文本、图像、视频和音频的单一解码器。
- Full Lifecycle Tooling:提供从原始数据准备、合成数据生成到 RLVR 与 MPO 对齐的全套工具。
- Extensive Context:支持高达 100 万 token 的上下文长度,适用于复杂的研究和企业工作流。