pranjalssh/fast.cu

Fastest kernels written from scratch

解决的问题

该项目提供完全从零开始编写的高性能GPU内核,旨在最大化现代NVIDIA硬件的性能,特别针对AI工作负载中至关重要的矩阵乘法和求和归约操作。

工作原理

针对特定硬件架构(H100 和 GB300)实现自定义CUDA内核。专注于最大化TFLOPs和内存带宽,提供H100上的BF16矩阵乘法实现,GB300上的NVFP4矩阵乘法实现,以及H100的求和归约内核。

适用人群

专注于GPU编程、CUDA优化以及AI推理和训练的高性能计算(HPC)的开发者和研究人员。

主要亮点

  • 在部分基准测试中,H100上的BF16矩阵乘法性能超过cuBLAS。
  • 使用CUDA 13.1支持GB300/B300硬件上的NVFP4矩阵乘法。
  • H100上的求和归约内核性能超越cuBLAS/cub库。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目