NVIDIA-NeMo/Nemotron

Developer Asset Hub for NVIDIA Nemotron — A one-stop resource for training recipes, usage cookbooks, datasets, and full end-to-end reference examples to build with Nemotron models

何を解決するか

Nemotronは、エージェント型AIを構築するために必要な、オープンで高効率なマルチモーダルモデルと完全なトレーニングインフラストラクチャを提供します。プロダクションレベルのLLMトレーニングの再現性の難しさに対処し、単なる孤立した例ではなく、生データのキュレーションや合成データ生成から、教師あり微調整(SFT)および強化学習(RL)までを含む完全なパイプラインを提供します。

仕組み

このプロジェクトは、再利用可能な作業単位である「ステップ」と、完全なパイプラインである「レシピ」にモジュール化されています。シーケンス効率と推論能力のバランスを取るために、ハイブリッドMamba-Transformer Mixture-of-Experts(MoE)アーキテクチャを採用しています。エコシステムはNVIDIAのスタックと統合されており、トレーニングにはMegatron-Bridge、強化学習にはNeMo-RL、最適化されたデプロイにはTensorRT-LLMが利用されています。

対象ユーザー

エージェントワークフロー向けの高性能モデルのトレーニング、微調整、デプロイを希望するAI研究者および開発者向けに設計されています。特に、コード作成、数学、科学的推論、マルチモーダル認識(テキスト、画像、動画、音声)に特化した能力が必要なユーザーに適しています。

主な特徴

  • 包括的なモデル階層: エッジ/PC向けのNanoからデータセンター規模のUltraまで、550B-A55B Ultraモデルを含むモデルを提供します。
  • ライフサイクル全体のツールキット: データキュレーション、合成データ生成(SDG)、ベンチマーク評価をカバーするCLIを備えています。
  • マルチモーダル機能: Nano Omniモデルは、1つのデコーダーでテキスト、画像、動画、音声をネイティブにサポートします。
  • 高度なトレーニング技術: Multi-Token Prediction(MTP)、非同期GRPO、最大100万トークンまでのプログレッシブコンテキストスケーリングを実装しています。

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch