NVIDIA/Megatron-LM
Ongoing research training transformer models at scale
解决的问题
Megatron-LM 解决了在数千个 GPU 上训练大规模 Transformer 模型(参数范围从 20 亿到 4620 亿)的挑战。它提供了处理大规模模型训练的内存和计算需求所需的底层架构,同时实现硬件效率最大化。
工作原理
该项目分为两个主要部分:Megatron Core,一个由 GPU 优化的构建块(内核、Transformer 组件和优化器)组成的模块化库;以及 Megatron-LM,一个将这些构建块与预配置训练脚本相结合的参考实现,以便于实验。
为了实现规模化,它采用了多种先进的并行策略:
- Tensor Parallelism (TP)、Pipeline Parallelism (PP)、Data Parallelism (DP)、Expert Parallelism (EP) 和 Context Parallelism (CP)。
- 支持多种混合精度格式以优化内存和速度,包括 FP16、BF16、FP8 和 FP4。
- 包含对 Mixture-of-Experts (MoE) 架构以及像 Falcon-H1 (Transformer-Mamba) 这样的混合架构的专门支持。
适用对象
- 需要高性能、模块化库来构建自定义训练流水线的 ML 工程师和框架开发人员。
- 正在寻找参考实现以快速实验和训练大规模语言模型的 研究团队。
亮点
- 极高的扩展性:能够在 6,144 个 H100 GPU 上训练高达 462B 参数的模型。
- 高硬件效率:在 H100 集群上实现高达 47% 的模型算力利用率 (MFU)。
- 广泛的架构支持:包括 DeepSeek-V4、MoE 模型和混合 Transformer-Mamba 架构的实现。
- 互操作性:通过 Megatron Bridge 提供 Hugging Face 与 Megatron 之间的双向检查点转换。
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目