NVIDIA-NeMo/Nemotron

Developer Asset Hub for NVIDIA Nemotron — A one-stop resource for training recipes, usage cookbooks, datasets, and full end-to-end reference examples to build with Nemotron models

解决的问题

Nemotron 提供了一组开源、高效率的多模态模型以及构建代理型 AI 所需的完整训练基础设施。它解决了生产级大语言模型训练难以复现的难题,提供从原始数据整理、合成数据生成到监督微调(SFT)和强化学习(RL)的完整流水线,而非孤立的示例。

如何工作

该项目采用模块化设计,分为可复用的「步骤」(工作单元)和完整的「配方」(流水线)。其采用混合 Mamba-Transformer 混合专家(MoE)架构,在序列效率与推理能力之间取得平衡。生态系统与 NVIDIA 的技术栈集成,包括用于训练的 Megatron-Bridge、用于强化学习的 NeMo-RL,以及用于优化部署的 TensorRT-LLM。

适用人群

专为希望训练、微调或部署高性能模型以支持代理型工作流的 AI 研究人员和开发者设计,尤其适用于需要在编程、数学、科学推理以及多模态感知(文本、图像、视频、音频)方面具备专业能力的用户。

主要亮点

  • 全面的模型层级:提供从边缘/PC 级别的 Nano 到数据中心规模的 Ultra 的多种模型,包括 550B-A55B Ultra 模型。
  • 全生命周期工具链:包含 CLI 工具,支持模块化步骤,涵盖数据整理、合成数据生成(SDG)和基准评估。
  • 多模态能力:Nano Omni 模型在单一解码器中原生支持文本、图像、视频和音频。
  • 先进训练技术:实现多标记预测(MTP)、异步 GRPO 以及最高达 1M 令牌的渐进式上下文扩展。

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch