NVIDIA-NeMo/Automodel
🚀 Pytorch Distributed native training library for LLMs/VLMs with OOTB Hugging Face support
🚀 NeMo AutoModel – 概要
NeMo AutoModel(NVIDIA-NeMo 組織がホスト)は、Pythonライブラリであり、大規模な言語モデル、ビジョン言語モデル、拡散モデルのファインチューニングや事前学習を、可能な限り少ないボイラープレートコードで実行できるようにします。PyTorchとNVIDIAの並列トレーニングスタック(DTensor、カスタムカーネル、テンソル並列性、パイプライン並列性など)の上に構築されており、Hugging Face上で公開されている数十の最先端モデル向けのレシピが用意されています。
核心的なアイデア
| アイデア | あなたにとっての意味 |
|---|---|
| モデル非依存のレシピ | 各サポート対象モデル(例:DeepSeek-V4.1-Flash、GLM-5.3、Qwen-3.8-Flash-Next、Nemotron-3-Ultra、Gemma-4など)には、データ読み込み、並列性、オプティマイザー、および特別なカーネルを設定するYAML定義のトレーニングスクリプトがあります。レシピをデータに指定して起動するだけです。 |
| フルパラメータおよびLoRA/PEFTサポート | モデルのすべての重みをトレーニングするか、パラメータ効率の良いファインチューニング(LoRA、PEFT)を使用できます – 両方に同じインターフェースが機能します。 |
| 投機的デコーディング & ドラフター | 投機的デコーディングによる高速推論を可能にする「ドラフト」モデル(EAGLE、DFlash、DSpark)のトレーニングに対する組み込みサポート。 |
| エージェントフレンドリーなスキル | 自動化エージェントやノートブックから呼び出せるコマンドライン「スキル」(例:run_recipe、model_onboard)の小さなコレクション。 |
| NVIDIA最適化カーネル | レシピは、H100/GB200 GPUから性能を引き出すためにカスタムカーネル(例:CSA2、FlexAttention、TileLang、cuDNN DSA)を自動的に選択します。 |
できること
- LLMのファインチューニング(Dense、MoE、ハイブリッドアテンション)を、HellaSwag、MedPix、またはカスタムデータセットなどの古典的ベンチマークで実行。
- ビジョン言語モデルのファインチューニング(LLaVA-OneVision、Qwen-VL、Inkling、MiniMax-M3)を、パックシーケンスまたはマルチトークン予測レシピで実行。
- 拡散モデルまたはD-LLMモデルのトレーニング(DiffusionGemma、DFlash)と、投機的デコーディングの実験。
- 単一GPUから数十のH100/GB200ノードへのスケーリングを、同じレシピを使用して実行。ライブラリは内部でテンソル並列性とパイプライン並列性を処理します。
- 新モデルの追加は、短いモデルカバレッジMDファイルとレシピを書くことで可能 – リポジトリにはすでに大規模なカタログが同梱されています。
始める(クイックスタート)
# 1. インストール(Python 3.10+ 必須)
pip install nemo-automodel
# 2. レシピを選択 – 例:HellaSwagでDeepSeek-V4.1-Flashをファインチューニング
python -m nemo_automodel.run \
--recipe examples/llm_finetune/deepseek_v41/deepseek_v41_flash_hellaswag_ep64_16nodes.yaml \
--data_path /path/to/hellaswag
YAMLファイルには、model、trainer、parallelism、datasetのセクションが含まれています。データパイプラインをカスタマイズしたい場合を除き、コードの変更は不要です。
ドキュメント & リソース
- 完全なドキュメント: https://docs.nvidia.com/nemo/automodel/latest/index.html
- モデルカバレッジリスト: https://docs.nvidia.com/nemo/automodel/latest/model-coverage/overview.html (サポート対象のすべてのモデルとその機能を表示)
- パフォーマンス概要: https://docs.nvidia.com/nemo/automodel/latest/performance-summary.html
- サンプルフォルダ: https://github.com/NVIDIA-NeMo/Automodel/tree/main/examples (LLM、VLM、拡散、投機的デコーディングなどのレシピ)
- コントリビューティングガイド: https://github.com/NVIDIA-NeMo/Automodel/blob/main/CONTRIBUTING.md
誰がこれを見るべきか?
- 研究者:最新のLLM/VLMアーキテクチャのための信頼性が高く、高性能なトレーニングパイプラインが必要な方。
- エンジニア:NVIDIA GPU上で本番環境のファインチューニングサービスを開発している方。
- ML-opsチーム:データオンボーディングからマルチノードトレーニングまでを単一のリポジトリで処理したい方。
ライセンス
このリポジトリは Apache 2.0 ライセンス(READMEのバッジを参照)の下で公開されています。
要約
NeMo AutoModelは、NVIDIAのターンキーライブラリであり、フルパラメータおよびパラメータ効率の良いオプションの両方を備え、投機的デコーディングおよびNVIDIA最適化カーネルの組み込みサポートとともに、大規模な現代の言語、ビジョン言語、拡散モデルのカタログをスケーラブルにファインチューニングします。
関連
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト