NVIDIA/Megatron-LM
Ongoing research training transformer models at scale
解決的問題
Megatron-LM 解決了在數千個 GPU 上訓練大規模 Transformer 模型(參數範圍從 20 億到 4620 億)的挑戰。它提供了處理大規模模型訓練的記憶體與計算需求所需的基礎設施,同時實現硬體效率最大化。
工作原理
該專案分為兩個主要部分:Megatron Core,一個由 GPU 優化的構建塊(核心、Transformer 組件與優化器)組成的模組化庫;以及 Megatron-LM,一個將這些構建塊與預配置訓練腳本相結合的參考實作,以便於實驗。
為了實現規模化,它採用了多種先進的並行策略:
- Tensor Parallelism (TP)、Pipeline Parallelism (PP)、Data Parallelism (DP)、Expert Parallelism (EP) 以及 Context Parallelism (CP)。
- 支援多種混合精度格式以優化記憶體與速度,包括 FP16、BF16、FP8 和 FP4。
- 包含對 Mixture-of-Experts (MoE) 架構以及像 Falcon-H1 (Transformer-Mamba) 這樣的混合架構的專門支援。
適用對象
- 需要高性能、模組化庫來構建自定義訓練流水線的 ML 工程師與框架開發人員。
- 正在尋找參考實作以快速實驗與訓練大規模語言模型的 研究團隊。
亮點
- 極高的擴展性:能夠在 6,144 個 H100 GPU 上訓練高達 462B 參數的模型。
- 高硬體效率:在 H100 集群上實現高達 47% 的模型算力利用率 (MFU)。
- 廣泛的架構支援:包括 DeepSeek-V4、MoE 模型以及混合 Transformer-Mamba 架構的實作。
- 互操作性:透過 Megatron Bridge 提供 Hugging Face 與 Megatron 之間的雙向檢查點轉換。
相關
- Dispatch
- 專案
- 專案
- 專案
- 專案