NVIDIA/Megatron-LM
Ongoing research training transformer models at scale
解決する課題
Megatron-LMは、数千のGPUにわたって大規模なトランスフォーマーモデル(20億から4620億パラメータ)をトレーニングする際の課題に対処します。ハードウェアの効率を最大化しながら、大規模なモデルトレーニングのメモリおよび計算需要を処理するために必要なインフラストラクチャを提供します。
仕組み
このプロジェクトは主に2つの部分に分かれています。GPUに最適化された構成可能なビルディングブロック(カーネル、トランスフォーマーコンポーネント、オプティマイザ)のライブラリであるMegatron Coreと、これらのブロックを事前設定済みのトレーニングスクリプトと組み合わせて、実験を容易にするリファレンス実装であるMegatron-LMです。
スケールを実現するために、以下の高度な並列化戦略を採用しています:
- Tensor Parallelism (TP)、Pipeline Parallelism (PP)、Data Parallelism (DP)、Expert Parallelism (EP)、および Context Parallelism (CP)。
- メモリと速度を最適化するために、FP16、BF16、FP8、FP4を含むさまざまな混合精度フォーマットをサポートしています。
- Mixture-of-Experts (MoE) アーキテクチャや、Falcon-H1 (Transformer-Mamba) のようなハイブリッドアーキテクチャへの特化したサポートが含まれています。
対象者
- カスタムトレーニングパイプラインを構築するために、高性能で構成可能なライブラリを必要とするMLエンジニアおよびフレームワーク開発者。
- 大規模言語モデルの実験やトレーニングを迅速に行うためのリファレンス実装を探している研究チーム。
ハイライト
- 極めて高いスケーラビリティ: 6,144枚のH100 GPUを使用して、最大462Bパラメータのモデルをトレーニング可能。
- 高いハードウェア効率: H100クラスター上で最大47%のModel FLOP Utilization (MFU) を達成。
- 幅広いアーキテクチャサポート: DeepSeek-V4、MoEモデル、およびハイブリッドTransformer-Mambaアーキテクチャの実装を含む。
- 相互運用性: Megatron Bridgeを介して、Hugging FaceとMegatronの間で双方向のチェックポイント変換を提供。
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト