NVIDIA/Megatron-LM

Ongoing research training transformer models at scale

解決的問題

Megatron-LM 解決了在數千個 GPU 上訓練大規模 Transformer 模型(參數範圍從 20 億到 4620 億)的挑戰。它提供了處理大規模模型訓練的記憶體與計算需求所需的基礎設施,同時實現硬體效率最大化。

工作原理

該專案分為兩個主要部分:Megatron Core,一個由 GPU 優化的構建塊(核心、Transformer 組件與優化器)組成的模組化庫;以及 Megatron-LM,一個將這些構建塊與預配置訓練腳本相結合的參考實作,以便於實驗。

為了實現規模化,它採用了多種先進的並行策略:

  • Tensor Parallelism (TP)Pipeline Parallelism (PP)Data Parallelism (DP)Expert Parallelism (EP) 以及 Context Parallelism (CP)
  • 支援多種混合精度格式以優化記憶體與速度,包括 FP16、BF16、FP8 和 FP4。
  • 包含對 Mixture-of-Experts (MoE) 架構以及像 Falcon-H1 (Transformer-Mamba) 這樣的混合架構的專門支援。

適用對象

  • 需要高性能、模組化庫來構建自定義訓練流水線的 ML 工程師與框架開發人員
  • 正在尋找參考實作以快速實驗與訓練大規模語言模型的 研究團隊

亮點

  • 極高的擴展性:能夠在 6,144 個 H100 GPU 上訓練高達 462B 參數的模型。
  • 高硬體效率:在 H100 集群上實現高達 47% 的模型算力利用率 (MFU)。
  • 廣泛的架構支援:包括 DeepSeek-V4、MoE 模型以及混合 Transformer-Mamba 架構的實作。
  • 互操作性:透過 Megatron Bridge 提供 Hugging Face 與 Megatron 之間的雙向檢查點轉換。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • 專案