NVIDIA-NeMo/Automodel

🚀 Pytorch Distributed native training library for LLMs/VLMs with OOTB Hugging Face support

解決的問題

NeMo AutoModel 簡化了大規模 AI 模型(包括 LLM、視覺語言模型 (VLMs)、擴散模型與檢索模型)的訓練與微調流程。它消除了引入新模型時通常涉及的「繁瑣步驟」與延遲,為 Hugging Face 模型提供「Day-0」支援,使其無需複雜的轉換即可立即進行訓練。

工作原理

作為基於 PyTorch DTensor 的原生 SPMD(單程式多數據)函式庫構建,它將模型程式碼與並行策略解耦。這使得只需透過調整配置網格,即可在任何規模(從單個 GPU 到數千個 GPU)上執行相同的訓練腳本。它使用 YAML 驅動的方案與用於覆蓋配置的 CLI,利用自定義核心與 PyTorch 原生並行(張量、序列與數據並行)來優化效能與記憶體效率。

適用對象

專為 AI 研究人員與生產工程師設計,他們需要將實驗從小型原型擴展到使用 Kubernetes 或 Slurm 的大規模多 GPU、多節點部署。

亮點

  • Day-0 Hugging Face 整合:無需格式轉換即可立即開始訓練 HF 模型。
  • 可擴展的並行性:透過配置混合使用張量、序列與數據並行,無需重寫模型程式碼。
  • YAML 驅動的工作流:使用預定義的方案實現極簡設定,並透過 CLI 覆蓋實現靈活性。
  • 廣泛的模型支援:相容於多種現代架構,包括 MoE(混合專家模型)與全模態模型。
  • 高性能:利用自定義核心與 PyTorch DTensor 實現優化的規模化訓練。