NVIDIA/Megatron-LM

Ongoing research training transformer models at scale

解决的问题

Megatron-LM 解决了在数千个 GPU 上训练大规模 Transformer 模型(参数范围从 20 亿到 4620 亿)的挑战。它提供了处理大规模模型训练的内存和计算需求所需的底层架构,同时实现硬件效率最大化。

工作原理

该项目分为两个主要部分:Megatron Core,一个由 GPU 优化的构建块(内核、Transformer 组件和优化器)组成的模块化库;以及 Megatron-LM,一个将这些构建块与预配置训练脚本相结合的参考实现,以便于实验。

为了实现规模化,它采用了多种先进的并行策略:

  • Tensor Parallelism (TP)Pipeline Parallelism (PP)Data Parallelism (DP)Expert Parallelism (EP)Context Parallelism (CP)
  • 支持多种混合精度格式以优化内存和速度,包括 FP16、BF16、FP8 和 FP4。
  • 包含对 Mixture-of-Experts (MoE) 架构以及像 Falcon-H1 (Transformer-Mamba) 这样的混合架构的专门支持。

适用对象

  • 需要高性能、模块化库来构建自定义训练流水线的 ML 工程师和框架开发人员
  • 正在寻找参考实现以快速实验和训练大规模语言模型的 研究团队

亮点

  • 极高的扩展性:能够在 6,144 个 H100 GPU 上训练高达 462B 参数的模型。
  • 高硬件效率:在 H100 集群上实现高达 47% 的模型算力利用率 (MFU)。
  • 广泛的架构支持:包括 DeepSeek-V4、MoE 模型和混合 Transformer-Mamba 架构的实现。
  • 互操作性:通过 Megatron Bridge 提供 Hugging Face 与 Megatron 之间的双向检查点转换。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目