pranjalssh/fast.cu
Fastest kernels written from scratch
解决的问题
该项目提供完全从零开始编写的高性能GPU内核,旨在最大化现代NVIDIA硬件的性能,特别针对AI工作负载中至关重要的矩阵乘法和求和归约操作。
工作原理
针对特定硬件架构(H100 和 GB300)实现自定义CUDA内核。专注于最大化TFLOPs和内存带宽,提供H100上的BF16矩阵乘法实现,GB300上的NVFP4矩阵乘法实现,以及H100的求和归约内核。
适用人群
专注于GPU编程、CUDA优化以及AI推理和训练的高性能计算(HPC)的开发者和研究人员。
主要亮点
- 在部分基准测试中,H100上的BF16矩阵乘法性能超过cuBLAS。
- 使用CUDA 13.1支持GB300/B300硬件上的NVFP4矩阵乘法。
- H100上的求和归约内核性能超越cuBLAS/cub库。
相关
- 项目
- 项目
- 项目
- 项目
- 项目