NVIDIA-NeMo/Nemotron
Developer Asset Hub for NVIDIA Nemotron — A one-stop resource for training recipes, usage cookbooks, datasets, and full end-to-end reference examples to build with Nemotron models
解決的問題
Nemotron 提供一組開源、高效率的多模態模型以及建構代理型 AI 所需的完整訓練基礎設施。它解決了生產級大語言模型訓練難以重現的難題,提供從原始資料整理、合成資料生成到監督微調(SFT)與強化學習(RL)的完整流程,而非孤立的範例。
如何運作
此專案採用模組化設計,分為可重複使用的「步驟」(工作單元)與完整的「配方」(流程)。其採用混合 Mamba-Transformer 混合專家(MoE)架構,在序列效率與推理能力之間取得平衡。生態系與 NVIDIA 的技術堆疊整合,包括用於訓練的 Megatron-Bridge、用於強化學習的 NeMo-RL,以及用於優化部署的 TensorRT-LLM。
適用對象
專為希望訓練、微調或部署高效率模型以支援代理型工作流程的 AI 研究人員與開發者設計,尤其適用於需要在程式設計、數學、科學推理以及多模態感知(文字、影像、影片、音訊)方面具備專業能力的使用者。
主要亮點
- 全面的模型層級:提供從邊緣/PC 級別的 Nano 到資料中心規模的 Ultra 的多種模型,包括 550B-A55B Ultra 模型。
- 全生命週期工具鏈:包含 CLI 工具,支援模組化步驟,涵蓋資料整理、合成資料生成(SDG)與基準評估。
- 多模態能力:Nano Omni 模型在單一解碼器中原生支援文字、影像、影片與音訊。
- 先進訓練技術:實現多標記預測(MTP)、非同步 GRPO 以及最高達 1M 標記的漸進式上下文擴展。
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch