colinlikescode/NanoGPT-Speedrun-Winner
Record breaking score (as of the first commit date)
解決する課題
このプロジェクトは、単一の 8xH100 GPU ノード上で、特定の検証損失(3.28)を可能な限り短い時間で達成するように設計された、GPT-2 (124M) 向けの高効率な学習パイプラインを実装しています。
動作原理
このプロジェクトは、以下の3つの主要な技術的最適化を実装することで、従来の速度記録を上回っています:
- 読み出し重みの Tail EMA:学習の最終段階でモデルを平均化して精度を向上させ、総学習ステップ数を 1300 から 1288 に削減できるようにします。
- Lean ReLU²:MLP 活性化の二乗のみを保存し、逆伝播時に入力を再構築することで、メモリトラフィックを削減します。
- MLP 残差最適化:大きなテンソルを再読み込みする代わりに、小さな恒等式から勾配を回復することで、メモリ帯域幅を節約します。
対象者
LLM 学習効率、GPU カーネル最適化、および modded-nanogpt スピードランチャレンジに参加している研究者やエンジニア向けです。
ハイライト
- 74.19〜74.6 秒の学習時間を達成し、従来の記録を更新しました。
- 8xH100 GPU 間でタイミングの正確性を確保するために、ペアリングされたレフェリーシステムを使用しています。
- 最大のパフォーマンスを発揮するために、PyTorch 2.10、Flash-Attention 3、および Triton 3.6 を活用しています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト