pranjalssh/fast.cu

Fastest kernels written from scratch

해결하는 문제

이 프로젝트는 최신 NVIDIA 하드웨어에서 최대 성능을 발휘하도록 완전히 새로 작성된 고성능 GPU 커널을 제공합니다. 특히 AI 워크로드에 핵심적인 행렬 곱셈과 합계 축소 연산에 초점을 맞춥니다.

작동 방식

H100 및 GB300 특정 하드웨어 아키텍처를 위한 커스텀 CUDA 커널을 구현합니다. TFLOPs와 메모리 대역폭을 극대화하는 데 중점을 두며, H100에서는 BF16 행렬 곱셈, GB300에서는 NVFP4 행렬 곱셈을 지원하고, H100용 합계 축소 커널도 제공합니다.

대상 사용자

GPU 프로그래밍, CUDA 최적화, AI 추론 및 학습을 위한 고성능 컴퓨팅(HPC)에 특화된 개발자 및 연구자.

주요 특징

  • 일부 벤치마크에서 cuBLAS를 초월하는 H100용 고성능 BF16 행렬 곱셈.
  • CUDA 13.1을 사용하여 GB300/B300 하드웨어에서 NVFP4 행렬 곱셈을 지원.
  • cuBLAS/cub 라이브러리보다 뛰어난 성능을 제공하는 H100용 합계 축소 커널.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트