pranjalssh/fast.cu
Fastest kernels written from scratch
解決的問題
本專案提供完全從零開始撰寫的高效率GPU內核,專為最大化現代NVIDIA硬體的效能而設計,特別針對AI工作負載中至關重要的矩陣乘法與求和歸約運算。
工作原理
針對特定硬體架構(H100 與 GB300)實作自訂CUDA內核。專注於最大化TFLOPs與記憶體頻寬,提供H100上的BF16矩陣乘法實作、GB300上的NVFP4矩陣乘法實作,以及H100用的求和歸約內核。
適用對象
專注於GPU程式設計、CUDA最佳化,以及AI推論與訓練用的高效能運算(HPC)之開發者與研究人員。
主要亮點
- 在部分基準測試中,H100上的BF16矩陣乘法效能超越cuBLAS。
- 使用CUDA 13.1支援GB300/B300硬體上的NVFP4矩陣乘法。
- H100用的求和歸約內核效能超越cuBLAS/cub函式庫。
相關
- 專案
- 專案
- 專案
- 專案
- 專案