pranjalssh/fast.cu

Fastest kernels written from scratch

解決的問題

本專案提供完全從零開始撰寫的高效率GPU內核,專為最大化現代NVIDIA硬體的效能而設計,特別針對AI工作負載中至關重要的矩陣乘法與求和歸約運算。

工作原理

針對特定硬體架構(H100 與 GB300)實作自訂CUDA內核。專注於最大化TFLOPs與記憶體頻寬,提供H100上的BF16矩陣乘法實作、GB300上的NVFP4矩陣乘法實作,以及H100用的求和歸約內核。

適用對象

專注於GPU程式設計、CUDA最佳化,以及AI推論與訓練用的高效能運算(HPC)之開發者與研究人員。

主要亮點

  • 在部分基準測試中,H100上的BF16矩陣乘法效能超越cuBLAS。
  • 使用CUDA 13.1支援GB300/B300硬體上的NVFP4矩陣乘法。
  • H100用的求和歸約內核效能超越cuBLAS/cub函式庫。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案