TongmingLAIC/AKO4ALL
Agentic Kernel Optimization for All — automated GPU kernel optimization for any kernel, any hardware, any language
解決的問題
AKO4ALL 自動化了 GPU 內核優化的繁瑣過程。無需人類專家手動進行效能分析和程式碼重寫以榨取效能,它使用 AI 代理反覆改進內核速度,同時確保其正確性。
工作原理
它被實作為 Claude Code 等編碼代理的「技能」(協定文件)。當在包含 GPU 內核的目錄中呼叫時,代理會遵循一個封閉迴路循環:建立工作區,驗證基線,使用 NVIDIA Nsight Compute (ncu) 對程式碼進行效能分析,重寫內核,對結果進行基準測試,並記錄進度。如果效能達到瓶頸,代理可能會進行網路搜尋以取得新的優化想法,或重新對程式碼進行效能分析以發現新的瓶頸。它支援多種語言,包括 Triton、CUDA、C++ 和 TileLang。
適用對象
專為希望在不為每個內核建構完整基礎設施的情況下,自動化優化流程的開發者與研究人員設計。
主要亮點
- 專家級效能:在 NVIDIA B200 上,針對 GQA 和 MLA 解碼/預填操作,實現了超過 FlashInfer 專家內核的加速效果。
- 語言無關:可優化以 Triton、CUDA、C++、Python 等撰寫的內核,甚至可切換語言以尋找更佳效能。
- 整合評估:內建評估器(KernelBench)與防作弊機制,防止代理操弄指標。
- 即插即用整合:作為 Claude Code 的單一技能運作,啟動優化任務僅需極少設定。
相關
- 專案
- 專案
- 專案
- 專案
- 專案