mirage-project/mirage

Mirage Persistent Kernel: Compiling LLMs into a MegaKernel

何を解決するか

Mirage Persistent Kernel (MPK) は、マルチGPU LLM推論に伴う高遅延を解決します。複数のGPUカーネルを起動するオーバーヘッドと、それらの間の通信ボトルネックを排除し、全体の推論プロセスを1つの「メガカーネル」に統合することで実現します。

どう動くか

MPKは、LLMの計算グラフを1つの統合GPUカーネルに変換するコンパイラおよびランタイムシステムです。各操作ごとに別々のカーネルを起動するのではなく、1回の起動ですべての必要な計算と通信を実行します。開発者は、rmsnorm_linear_layerなどの統合演算を連結してカーネルの入力・出力および計算グラフを定義し、その後グラフを最適化された実行可能カーネルにコンパイルします。

対象ユーザー

低遅延LLM推論およびGPU最適化に注力するMLエンジニアや研究者で、広範な手動CUDAプログラミングなしに推論遅延を削減したい方。

主な特徴

  • 顕著な遅延低減: LLM推論遅延を1.2倍から6.7倍まで削減。
  • エンドツーエンドの統合: 計算と通信を1つのGPUカーネル起動に統合。
  • 自動コンパイル: 高レベルのPython APIを使用してHugging Faceモデルをメガカーネルにコンパイル可能。
  • 統合プロファイリング: メガカーネル内の各タスクの実行タイムラインを可視化するツールを内蔵。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト