TongmingLAIC/AKO4ALL

Agentic Kernel Optimization for All — automated GPU kernel optimization for any kernel, any hardware, any language

何を解決するか

AKO4ALLは、GPUカーネル最適化の面倒なプロセスを自動化します。人間の専門家が手動でプロファイリングとコードの書き換えを行い、性能を引き出すのではなく、AIエージェントを使ってカーネルの速度を反復的に改善しながら、正しさを保証します。

動作方法

これは、Claude Codeなどのコーディングエージェント向けの「スキル」(プロトコルドキュメント)として実装されています。GPUカーネルを含むディレクトリで呼び出されると、エージェントはクローズドループのサイクルに従います:ワークスペースを作成し、ベースラインを検証し、NVIDIA Nsight Compute (ncu) を使ってコードをプロファイリングし、カーネルを書き換え、結果をベンチマークし、進捗をログに記録します。性能が頭打ちになった場合、エージェントは新しい最適化アイデアを探すためにウェブ検索を行うか、コードを再プロファイリングして新たなボトルネックを特定します。Triton、CUDA、C++、TileLangなど、さまざまな言語をサポートしています。

対象ユーザー

高性能GPUカーネルを扱う開発者や研究者で、各カーネルごとに大規模なインフラを構築せずに最適化プロセスを自動化したい人向けです。

特徴

  • 専門家レベルのパフォーマンス:NVIDIA B200上で、GQAやMLAのデコード/プリフィル演算子において、FlashInferの専門家カーネルを上回るスピードアップを実証しました。
  • 言語に依存しない:Triton、CUDA、C++、Pythonなど、さまざまな言語で書かれたカーネルを最適化でき、必要に応じて言語を切り替えてより良いパフォーマンスを探索できます。
  • 統合評価:組み込みの評価器(KernelBench)と、エージェントがメトリクスを操作するのを防ぐためのアンチチートメカニズムを備えています。
  • 即時統合:Claude Code用の単一のスキルとして機能し、最適化実行を開始するための最小限の設定で済みます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト