pranjalssh/fast.cu

Fastest kernels written from scratch

何を解決するか

このプロジェクトは、最新のNVIDIAハードウェアのパフォーマンスを最大限に引き出すために、完全に独自に書かれた高度に最適化されたGPUカーネルを提供します。特にAIワークロードに不可欠な行列乗算と和の還元操作に焦点を当てています。

仕組み

H100およびGB300という特定のハードウェアアーキテクチャ向けに、カスタムCUDAカーネルを実装しています。TFLOPsとメモリ帯域幅を最大化することに注力し、H100ではBF16行列乗算、GB300ではNVFP4行列乗算の実装を提供するとともに、H100向けの和の還元カーネルも提供しています。

対象ユーザー

GPUプログラミング、CUDA最適化、AI推論および学習向けハイパフォーマンスコンピューティング(HPC)に特化した開発者および研究者。

主な特徴

  • BF16行列乗算において、一部のベンチマークでcuBLASを上回るH100向けの高性能実装。
  • CUDA 13.1を使用して、GB300/B300ハードウェア向けのNVFP4行列乗算をサポート。
  • cuBLAS/cubライブラリを上回るパフォーマンスを実現するH100向けの和の還元カーネル。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト