Dogacel/auto-gpu-kernel
Winner 🏆 (Agent-only) MLSys 2026 - FlashInfer AI Kernel Generation Contest for the DeepSeek Sparse Attention (DSA) track with an average speedup of 34.93x
解決的問題
自動化GPU內核的發現與最佳化,這通常是一項手動且高耗時的工程任務。透過使用穩健的驗證與基準測試流程,防止常見的AI代理失敗,例如對雜訊性能測量做出反應或陷入局部最佳解。
如何運作
系統使用最佳化代理(kopt)與驗證/基準測試工具(kbench)。可運作於兩種模式:使用 flashinfer 格式進行特定內核生成,或使用自訂格式以針對任何Git倉庫。對於任意倉庫,設定代理會先檢視程式碼,並根據目標與測量標準的自然語言描述,產生自訂的基準測試與驗證框架(harness/validate.py 與 harness/benchmark.py)。隨後,代理會反覆最佳化程式碼,kbench 提供歸一化測量值與A/B測試,以確保實際加速效果。
適用對象
希望自動化低階GPU程式碼性能調校,或在不手動撰寫基準測試的情況下加速現有倉庫推理的GPU內核工程師與AI研究人員。
主要亮點
- 已驗證的效能:在MLSys 2026 FlashInfer AI內核生成競賽中,針對DeepSeek稀疏注意力任務獲得第一名,平均加速達34.93倍。
- 自主生成測試框架:可根據自然語言任務,自動為任何Git倉庫建立驗證與基準測試腳本。
- 穩健的驗證機制:專注於嚴格的驗證流程,避免測量雜訊與「偽裝」的效能提升。
- 彈性執行方式:支援本地GPU執行或透過Modal進行雲端執行。
相關
- 專案
- 專案
- 專案
- 專案