TongmingLAIC/AKO4ALL
Agentic Kernel Optimization for All — automated GPU kernel optimization for any kernel, any hardware, any language
解决的问题
AKO4ALL 自动化了 GPU 内核优化的繁琐过程。无需人类专家手动进行性能分析和代码重写以榨取性能,它使用 AI 代理迭代改进内核速度,同时确保其正确性。
工作原理
它被实现为 Claude Code 等编码代理的「技能」(协议文档)。当在包含 GPU 内核的目录中调用时,代理会遵循一个闭环循环:创建工作区,验证基线,使用 NVIDIA Nsight Compute (ncu) 对代码进行性能分析,重写内核,对结果进行基准测试,并记录进展。如果性能达到瓶颈,代理可能会进行网络搜索以获取新的优化思路,或重新对代码进行性能分析以发现新的瓶颈。它支持多种语言,包括 Triton、CUDA、C++ 和 TileLang。
适用人群
专为希望在不为每个内核构建完整基础设施的情况下,自动化优化流程的开发者和研究人员设计。
主要亮点
- 专家级性能:在 NVIDIA B200 上,针对 GQA 和 MLA 解码/预填充操作,实现了超过 FlashInfer 专家内核的加速效果。
- 语言无关:可优化用 Triton、CUDA、C++、Python 等编写的内核,甚至可切换语言以寻找更优性能。
- 集成评估:内置评估器(KernelBench)和防作弊机制,防止代理操纵指标。
- 即插即用集成:作为 Claude Code 的单一技能运行,启动优化任务仅需极少配置。
相关
- 项目
- 项目
- 项目
- 项目
- 项目