mirage-project/mirage
Mirage Persistent Kernel: Compiling LLMs into a MegaKernel
何を解決するか
Mirage Persistent Kernel (MPK) は、マルチGPU LLM推論に伴う高遅延を解決します。複数のGPUカーネルを起動するオーバーヘッドと、それらの間の通信ボトルネックを排除し、全体の推論プロセスを1つの「メガカーネル」に統合することで実現します。
どう動くか
MPKは、LLMの計算グラフを1つの統合GPUカーネルに変換するコンパイラおよびランタイムシステムです。各操作ごとに別々のカーネルを起動するのではなく、1回の起動ですべての必要な計算と通信を実行します。開発者は、rmsnorm_linear_layerなどの統合演算を連結してカーネルの入力・出力および計算グラフを定義し、その後グラフを最適化された実行可能カーネルにコンパイルします。
対象ユーザー
低遅延LLM推論およびGPU最適化に注力するMLエンジニアや研究者で、広範な手動CUDAプログラミングなしに推論遅延を削減したい方。
主な特徴
- 顕著な遅延低減: LLM推論遅延を1.2倍から6.7倍まで削減。
- エンドツーエンドの統合: 計算と通信を1つのGPUカーネル起動に統合。
- 自動コンパイル: 高レベルのPython APIを使用してHugging Faceモデルをメガカーネルにコンパイル可能。
- 統合プロファイリング: メガカーネル内の各タスクの実行タイムラインを可視化するツールを内蔵。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト