Dogacel/auto-gpu-kernel

Winner 🏆 (Agent-only) MLSys 2026 - FlashInfer AI Kernel Generation Contest for the DeepSeek Sparse Attention (DSA) track with an average speedup of 34.93x

해결하는 문제

GPU 커널의 탐색과 최적화를 자동화하여 일반적으로 수작업으로 고도의 엔지니어링 작업이 필요한 과정을 간소화합니다. 노이즈가 많은 성능 측정에 반응하거나 국소 최적값에 갇히는 등의 AI 에이전트의 일반적인 실패를 견고한 검증 및 벤치마크 파이프라인을 통해 방지합니다.

작동 방식

시스템은 최적화 에이전트(kopt)와 검증/벤치마크 도구(kbench)를 사용합니다. flashinfer 형식을 사용해 특정 커널을 생성하거나, 임의의 Git 리포지토리에 타겟팅할 수 있는 커스텀 형식의 두 가지 모드로 작동할 수 있습니다. 임의의 리포지토리의 경우, 설정 에이전트가 먼저 코드를 검사하고 목적과 측정 기준에 대한 일반 언어 설명을 기반으로 커스텀 벤치마크 및 검증 허브(harness/validate.pyharness/benchmark.py)를 생성합니다. 이후 에이전트는 코드를 반복적으로 최적화하며, kbench는 정규화된 측정값과 A/B 테스트를 제공하여 실제 성능 향상을 보장합니다.

대상 사용자

저수준 GPU 코드의 성능 튜닝을 자동화하고 싶은 GPU 커널 엔지니어 및 AI 연구자. 수동으로 벤치마크를 작성하지 않고도 기존 리포지토리의 추론 속도를 빠르게 개선하고 싶은 사람들을 위한 도구입니다.

주요 특징

  • 실증된 성능: DeepSeek Sparse Attention에서 MLSys 2026 FlashInfer AI 커널 생성 대회에서 1위를 차지하며 평균 34.93배의 성능 향상을 달성했습니다.
  • 자율적 허브 생성: 자연어 작업 기반으로 어떤 Git 리포지토리에도 검증 및 벤치마크 스크립트를 자동 생성할 수 있습니다.
  • 견고한 검증: 측정 노이즈와 '가짜' 개선을 방지하기 위해 엄격한 검증 파이프라인에 중점을 둡니다.
  • 유연한 실행: 로컬 GPU 실행 또는 Modal을 통한 클라우드 기반 실행을 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트