Dao-AILab/quack
A Quirky Assortment of CuTe Kernels
해결하는 문제
QuACK은 일반적인 딥러닝 연산을 위한 고성능 GPU 커널의 모음으로, CuTe-DSL을 사용하여 Python에서 직접 "빛의 속도" 성능을 달성할 수 있도록 합니다.
작동 방식
이 프로젝트는 NVIDIA GPU를 위한 도메인 특화 언어인 CuTe-DSL을 사용하여 다양한 수학적 연산(커널)을 구현합니다. H100, B200/B300, RTX 50 GPU와 같은 최신 NVIDIA 하드웨어를 지원하며, JAX용 선택적 바인딩도 제공합니다.
대상 사용자
고성능 NVIDIA GPU를 사용하는 연구자 및 엔지니어를 위한 것으로, 정규화 및 행렬 곱셈(GEMM)과 같은 연산에 최적화된 GPU 커널이 필요하지만, 저수준 CUDA C++를 직접 작성하고 싶지 않은 경우에 적합합니다.
주요 특징
- RMSNorm, Softmax, Cross Entropy, LayerNorm(전방 및 후방 전파 모두)을 위한 최적화된 커널.
- Hopper 및 Blackwell 아키텍처용 특화된 GEMM 및 에피로그 구현.
- JAX와의 통합을 위한 선택적 바인딩 제공.
- 최신 CUDA 툴킷(12.9+) 및 Python 3.12 지원.
관련
- 프로젝트
NVIDIA/cutlassA collection of CUDA C++ and Python DSL abstractions for implementing high-performance matrix-matrix multiplication (GEMM) and the related linear algebra operations on NVIDIA GPUs.
- 프로젝트
NVIDIA/cudnn-frontendNVIDIA’s cuDNN Frontend is an open‑source, header‑only C++ API plus Python package that wraps the cuDNN Graph API. It provides easy‑to‑use graph construction, autotuning, and a catalog of open‑source high‑performance kernels (Flash‑Attention, fused GEMM + SwiGLU, block‑sparse attention, etc.) for Hopper/Blackwell GPUs. Install via pip or include the header; integrates with PyTorch and lets researchers and engineers get backend‑level speed without writing CUDA kernels from scratch.
- 프로젝트
MoonshotAI/FlashKDANVIDIA SM90+ GPU를 위한 CUTLASS 기반 고성능 CUDA 커널 구현인 Kimi Delta Attention (KDA). `flash-linear-attention` 라이브러리의 최적화된 백엔드로 사용된다.
- 프로젝트
lattice/qudaNVIDIA 하드웨어에서 작동하는 격자 QCD 계산을 위한 GPU 가속 라이브러리로, 다양한 페르미온 작용에 대해 최적화된 디랙 연산자와 해법을 제공합니다.
- 프로젝트
deepseek-ai/DeepGEMMNVIDIA GPU를 위한 고성능 Tensor Core 커널 라이브러리로, 최적화된 GEMM, MoE 및 MQA 커널을 제공하여 LLM 학습 및 추론을 가속화합니다.