Dogacel/auto-gpu-kernel

Winner 🏆 (Agent-only) MLSys 2026 - FlashInfer AI Kernel Generation Contest for the DeepSeek Sparse Attention (DSA) track with an average speedup of 34.93x

解决的问题

自动化发现和优化GPU内核,这通常是一项手动且高投入的工程任务。通过使用稳健的验证和基准测试管道,防止常见的AI代理失败,例如对噪声性能测量做出反应或陷入局部最优解。

工作原理

系统使用优化代理(kopt)和验证/基准测试工具(kbench)。它可以在两种模式下运行:使用 flashinfer 格式进行特定内核生成,或使用自定义格式以针对任何Git仓库。对于任意仓库,设置代理首先检查代码,并根据目标和测量标准的自然语言描述生成自定义的基准测试和验证框架(harness/validate.pyharness/benchmark.py)。然后,代理会迭代优化代码,kbench 提供归一化测量值和A/B测试,以确保实际性能提升。

适用人群

希望自动化低级GPU代码性能调优,或在不手动编写基准测试的情况下加速现有仓库推理的GPU内核工程师和AI研究人员。

主要亮点

  • 已验证性能:在MLSys 2026 FlashInfer AI内核生成竞赛中,针对DeepSeek稀疏注意力任务排名第一,平均提速达34.93倍。
  • 自主生成测试框架:可根据自然语言任务,自动为任意Git仓库构建验证和基准测试脚本。
  • 稳健的验证机制:专注于严格的验证流程,避免测量噪声和“虚假”性能提升。
  • 灵活执行方式:支持本地GPU执行或通过Modal进行云上执行。

相关

  • 项目
  • 项目
  • 项目
  • 项目