NVIDIA-NeMo/Automodel
🚀 Pytorch Distributed native training library for LLMs/VLMs with OOTB Hugging Face support
解決的問題
NeMo AutoModel 簡化了大規模 AI 模型(包括 LLM、視覺語言模型 (VLMs)、擴散模型與檢索模型)的訓練與微調流程。它消除了引入新模型時通常涉及的「繁瑣步驟」與延遲,為 Hugging Face 模型提供「Day-0」支援,使其無需複雜的轉換即可立即進行訓練。
工作原理
作為基於 PyTorch DTensor 的原生 SPMD(單程式多數據)函式庫構建,它將模型程式碼與並行策略解耦。這使得只需透過調整配置網格,即可在任何規模(從單個 GPU 到數千個 GPU)上執行相同的訓練腳本。它使用 YAML 驅動的方案與用於覆蓋配置的 CLI,利用自定義核心與 PyTorch 原生並行(張量、序列與數據並行)來優化效能與記憶體效率。
適用對象
專為 AI 研究人員與生產工程師設計,他們需要將實驗從小型原型擴展到使用 Kubernetes 或 Slurm 的大規模多 GPU、多節點部署。
亮點
- Day-0 Hugging Face 整合:無需格式轉換即可立即開始訓練 HF 模型。
- 可擴展的並行性:透過配置混合使用張量、序列與數據並行,無需重寫模型程式碼。
- YAML 驅動的工作流:使用預定義的方案實現極簡設定,並透過 CLI 覆蓋實現靈活性。
- 廣泛的模型支援:相容於多種現代架構,包括 MoE(混合專家模型)與全模態模型。
- 高性能:利用自定義核心與 PyTorch DTensor 實現優化的規模化訓練。