pranjalssh/fast.cu
Fastest kernels written from scratch
何を解決するか
このプロジェクトは、最新のNVIDIAハードウェアのパフォーマンスを最大限に引き出すために、完全に独自に書かれた高度に最適化されたGPUカーネルを提供します。特にAIワークロードに不可欠な行列乗算と和の還元操作に焦点を当てています。
仕組み
H100およびGB300という特定のハードウェアアーキテクチャ向けに、カスタムCUDAカーネルを実装しています。TFLOPsとメモリ帯域幅を最大化することに注力し、H100ではBF16行列乗算、GB300ではNVFP4行列乗算の実装を提供するとともに、H100向けの和の還元カーネルも提供しています。
対象ユーザー
GPUプログラミング、CUDA最適化、AI推論および学習向けハイパフォーマンスコンピューティング(HPC)に特化した開発者および研究者。
主な特徴
- BF16行列乗算において、一部のベンチマークでcuBLASを上回るH100向けの高性能実装。
- CUDA 13.1を使用して、GB300/B300ハードウェア向けのNVFP4行列乗算をサポート。
- cuBLAS/cubライブラリを上回るパフォーマンスを実現するH100向けの和の還元カーネル。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト