NVIDIA-NeMo/Automodel

🚀 Pytorch Distributed native training library for LLMs/VLMs with OOTB Hugging Face support

🚀 NeMo AutoModel – 簡介

NeMo AutoModel(託管於 NVIDIA-NeMo 組織下)是一個 Python 函式庫,讓您能夠以盡可能少的樣板程式碼來微調或預訓練巨大的語言、視覺-語言和擴散模型。它建構在 PyTorch 和 NVIDIA 的並行訓練棧(DTensor、自訂核心、張量並行、流水線並行等)之上,並為 Hugging Face 上數十個最先進的模型提供了現成的配方


核心理念

理念 對您的意義
模型無關的配方 每個支援的模型(例如 DeepSeek-V4.1-Flash、GLM-5.3、Qwen-3.8-Flash-Next、Nemotron-3-Ultra、Gemma-4 等)都有一個 YAML 定義的訓練腳本,用於設定資料載入、並行性、最佳化器以及任何特殊核心。您只需將配方指向您的資料並啟動即可。
全參數和 LoRA/PEFT 支援 您可以訓練模型的每個權重,或使用參數高效微調(LoRA、PEFT)– 相同的介面對兩者都有效。
投機解碼與草稿器 內建支援訓練「草稿」模型(EAGLE、DFlash、DSpark),透過投機解碼實現更快的推論。
代理友好的技能 一小部分命令列「技能」(例如 run_recipemodel_onboard),可由自動化代理或筆記本呼叫。
NVIDIA 最佳化核心 配方會自動選擇自訂核心(例如 CSA2、FlexAttention、TileLang、cuDNN DSA),以從 H100/GB200 GPU 中榨取效能。

您可以做什麼

  • 微調 LLM(密集、MoE、混合注意力)在 HellaSwag、MedPix 或自訂資料集等經典基準上。
  • 微調視覺-語言模型(LLaVA-OneVision、Qwen-VL、Inkling、MiniMax-M3)使用打包序列或多令牌預測配方。
  • 訓練擴散或 D-LLM 模型(DiffusionGemma、DFlash)並實驗投機解碼。
  • 從單一 GPU 擴展到數十個 H100/GB200 節點使用相同的配方;函式庫在底層處理張量和流水線並行。
  • 新增新模型透過撰寫簡短的模型覆蓋 MD 檔案和配方 – 儲存庫已經附帶了一個大型目錄。

快速入門

# 1. 安裝(需要 Python 3.10+)
pip install nemo-automodel

# 2. 選擇一個配方 – 例如,在 HellaSwag 上微調 DeepSeek-V4.1-Flash
python -m nemo_automodel.run \
    --recipe examples/llm_finetune/deepseek_v41/deepseek_v41_flash_hellaswag_ep64_16nodes.yaml \
    --data_path /path/to/hellaswag

YAML 檔案包含 modeltrainerparallelismdataset 部分。除非您想要自訂資料管線,否則無需變更程式碼。


文件與資源


誰應該關注這個?

  • 研究人員:需要可靠、高效能的訓練管線來處理最新的 LLM/VLM 架構。
  • 工程師:在 NVIDIA GPU 上建置生產級微調服務。
  • ML-ops 團隊:希望使用單一儲存庫來處理從資料接入到多節點訓練的所有事情。

授權條款

該儲存庫在 Apache 2.0 授權條款下發布(參見 README 中的徽章)。


總結

NeMo AutoModel 是 NVIDIA 的交鑰匙函式庫,用於大規模微調大量現代語言、視覺-語言和擴散模型,提供全參數和參數高效選項,並內建對投機解碼和 NVIDIA 最佳化核心的支援。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案