cursor/mixture-of-kittens

Mixture-of-experts (MoE) training megakernel for NVL72s

何を解決するか

Mixture-of-Kittens (MoK) は、ハイエンドのNVIDIA Blackwell NVL72システム上でMixture-of-Experts (MoE) モデルを訓練する際の効率的なボトルネックを解決します。特に、CPU-GPU同期によるオーバーヘッドと、MoE訓練中に計算と通信が分離されていることによる遅延をターゲットとしており、これにより訓練プロセスが遅延することがあります。

仕組み

MoKは、すべてのMoE計算と通信を1つのCUDAカーネルに統合する決定論的「メガカーネル」です。これにより、コンピューティングとGPU間ネットワーキングを設定可能な粒度で重ね合わせ、CPU-GPU同期の完全な不要化を実現します。BF16およびMXFP8の精度形式をサポートし、順伝播と逆伝播の両方を処理できます。

対象ユーザー

このプロジェクトは、NVIDIA Blackwell GPU(SM100またはSM103)と大規模なMoE訓練に取り組む研究者およびエンジニア向けに設計されています。たとえば、プロダクションレベルのLLMを訓練している人などです。

特徴

  • 高いパフォーマンス: 最速のベースラインと比較して、MXFP8順伝播で最大2.37倍高速、BF16順伝播で最大1.92倍高速。
  • 統合カーネル: 計算と通信を1つの操作に統合し、ハードウェア利用効率を最大化。
  • 精度サポート: 最適化された訓練のためのBF16およびMXFP8をサポート。
  • 二層API: CUDAカーネル呼び出しに直接対応する低レベル「Opsレイヤー」と、生産環境への統合を容易にする高レベル「Functionalレイヤー」を提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト