colinlikescode/NanoGPT-Speedrun-Winner

Record breaking score (as of the first commit date)

解決する課題

このプロジェクトは、単一の 8xH100 GPU ノード上で、特定の検証損失(3.28)を可能な限り短い時間で達成するように設計された、GPT-2 (124M) 向けの高効率な学習パイプラインを実装しています。

動作原理

このプロジェクトは、以下の3つの主要な技術的最適化を実装することで、従来の速度記録を上回っています:

  1. 読み出し重みの Tail EMA:学習の最終段階でモデルを平均化して精度を向上させ、総学習ステップ数を 1300 から 1288 に削減できるようにします。
  2. Lean ReLU²:MLP 活性化の二乗のみを保存し、逆伝播時に入力を再構築することで、メモリトラフィックを削減します。
  3. MLP 残差最適化:大きなテンソルを再読み込みする代わりに、小さな恒等式から勾配を回復することで、メモリ帯域幅を節約します。

対象者

LLM 学習効率、GPU カーネル最適化、および modded-nanogpt スピードランチャレンジに参加している研究者やエンジニア向けです。

ハイライト

  • 74.19〜74.6 秒の学習時間を達成し、従来の記録を更新しました。
  • 8xH100 GPU 間でタイミングの正確性を確保するために、ペアリングされたレフェリーシステムを使用しています。
  • 最大のパフォーマンスを発揮するために、PyTorch 2.10、Flash-Attention 3、および Triton 3.6 を活用しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト