Dogacel/auto-gpu-kernel

Winner 🏆 (Agent-only) MLSys 2026 - FlashInfer AI Kernel Generation Contest for the DeepSeek Sparse Attention (DSA) track with an average speedup of 34.93x

何を解決するか

GPUカーネルの発見と最適化を自動化し、通常は手作業で高負荷なエンジニアリング作業となるタスクを効率化します。ノイズの多いパフォーマンス測定への反応や局所最適解に陥るといったAIエージェントの一般的な失敗を、堅牢な検証およびベンチマークパイプラインにより防止します。

動作方法

システムは最適化エージェント(kopt)と検証/ベンチマークツール(kbench)を使用します。flashinferフォーマットを用いた特定のカーネル生成または、任意のGitリポジトリをターゲットにできるカスタムフォーマットの2つのモードで動作可能です。任意のリポジトリの場合、まずセットアップエージェントがコードを検査し、目的と測定基準の自然言語記述に基づいてカスタムのベンチマークおよび検証ハーネス(harness/validate.pyharness/benchmark.py)を生成します。その後、エージェントはコードを反復的に最適化し、kbenchが正規化された測定値とA/Bテストを提供して実際の高速化を保証します。

対象ユーザー

低レベルGPUコードのパフォーマンスチューニングを自動化したいGPUカーネルエンジニアやAI研究者。手動でベンチマークを書かずに、既存のリポジトリでの推論を高速化したい人向けです。

主な特徴

  • 実証済みのパフォーマンス:DeepSeek Sparse Attentionにおいて、MLSys 2026 FlashInfer AIカーネル生成コンテストで第1位を獲得し、平均34.93倍の高速化を達成。
  • 自律的なハーネス生成:自然言語タスクに基づき、任意のGitリポジトリに対して検証およびベンチマークスクリプトを自動生成可能。
  • 堅牢な検証:測定ノイズや「偽の」改善を回避するため、厳格な検証パイプラインに注力。
  • 柔軟な実行:ローカルGPU実行またはModalを介したクラウドベース実行をサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト