NVIDIA-NeMo/Automodel
🚀 Pytorch Distributed native training library for LLMs/VLMs with OOTB Hugging Face support
🚀 NeMo AutoModel – 簡介
NeMo AutoModel(託管於 NVIDIA-NeMo 組織下)是一個 Python 函式庫,讓您能夠以盡可能少的樣板程式碼來微調或預訓練巨大的語言、視覺-語言和擴散模型。它建構在 PyTorch 和 NVIDIA 的並行訓練棧(DTensor、自訂核心、張量並行、流水線並行等)之上,並為 Hugging Face 上數十個最先進的模型提供了現成的配方。
核心理念
| 理念 | 對您的意義 |
|---|---|
| 模型無關的配方 | 每個支援的模型(例如 DeepSeek-V4.1-Flash、GLM-5.3、Qwen-3.8-Flash-Next、Nemotron-3-Ultra、Gemma-4 等)都有一個 YAML 定義的訓練腳本,用於設定資料載入、並行性、最佳化器以及任何特殊核心。您只需將配方指向您的資料並啟動即可。 |
| 全參數和 LoRA/PEFT 支援 | 您可以訓練模型的每個權重,或使用參數高效微調(LoRA、PEFT)– 相同的介面對兩者都有效。 |
| 投機解碼與草稿器 | 內建支援訓練「草稿」模型(EAGLE、DFlash、DSpark),透過投機解碼實現更快的推論。 |
| 代理友好的技能 | 一小部分命令列「技能」(例如 run_recipe、model_onboard),可由自動化代理或筆記本呼叫。 |
| NVIDIA 最佳化核心 | 配方會自動選擇自訂核心(例如 CSA2、FlexAttention、TileLang、cuDNN DSA),以從 H100/GB200 GPU 中榨取效能。 |
您可以做什麼
- 微調 LLM(密集、MoE、混合注意力)在 HellaSwag、MedPix 或自訂資料集等經典基準上。
- 微調視覺-語言模型(LLaVA-OneVision、Qwen-VL、Inkling、MiniMax-M3)使用打包序列或多令牌預測配方。
- 訓練擴散或 D-LLM 模型(DiffusionGemma、DFlash)並實驗投機解碼。
- 從單一 GPU 擴展到數十個 H100/GB200 節點使用相同的配方;函式庫在底層處理張量和流水線並行。
- 新增新模型透過撰寫簡短的模型覆蓋 MD 檔案和配方 – 儲存庫已經附帶了一個大型目錄。
快速入門
# 1. 安裝(需要 Python 3.10+)
pip install nemo-automodel
# 2. 選擇一個配方 – 例如,在 HellaSwag 上微調 DeepSeek-V4.1-Flash
python -m nemo_automodel.run \
--recipe examples/llm_finetune/deepseek_v41/deepseek_v41_flash_hellaswag_ep64_16nodes.yaml \
--data_path /path/to/hellaswag
YAML 檔案包含 model、trainer、parallelism 和 dataset 部分。除非您想要自訂資料管線,否則無需變更程式碼。
文件與資源
- 完整文件: https://docs.nvidia.com/nemo/automodel/latest/index.html
- 模型覆蓋清單: https://docs.nvidia.com/nemo/automodel/latest/model-coverage/overview.html (顯示每個支援的模型及其功能)
- 效能摘要: https://docs.nvidia.com/nemo/automodel/latest/performance-summary.html
- 範例資料夾: https://github.com/NVIDIA-NeMo/Automodel/tree/main/examples (LLM、VLM、擴散、投機解碼等的配方)
- 貢獻指南: https://github.com/NVIDIA-NeMo/Automodel/blob/main/CONTRIBUTING.md
誰應該關注這個?
- 研究人員:需要可靠、高效能的訓練管線來處理最新的 LLM/VLM 架構。
- 工程師:在 NVIDIA GPU 上建置生產級微調服務。
- ML-ops 團隊:希望使用單一儲存庫來處理從資料接入到多節點訓練的所有事情。
授權條款
該儲存庫在 Apache 2.0 授權條款下發布(參見 README 中的徽章)。
總結
NeMo AutoModel 是 NVIDIA 的交鑰匙函式庫,用於大規模微調大量現代語言、視覺-語言和擴散模型,提供全參數和參數高效選項,並內建對投機解碼和 NVIDIA 最佳化核心的支援。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案