MoonshotAI/FlashKDA
FlashKDA: high-performance Kimi Delta Attention kernels
해결하는 문제
FlashKDA는 Kimi Delta Attention (KDA)를 위한 고성능 CUDA 커널을 제공합니다. 이는 선형 어텐션 메커니즘으로, 특정 어텐션 변형을 사용하는 모델의 속도와 메모리 효율을 향상시키기 위해 효율적이고 하드웨어 가속된 계산이 필요함을 해결합니다.
작동 방식
이 프로젝트는 CUTLASS 라이브러리를 기반으로 하며, 특히 NVIDIA SM90(H100) 이상 아키텍처를 대상으로 합니다. flash-linear-attention (FLA) 라이브러리의 백엔드로 통합되어, 사용자가 표준 Triton 기반 구현 대신 최적화된 C++ 커널을 사용하여 더 높은 성능을 얻을 수 있도록 합니다.
대상 사용자
선형 어텐션 모델을 다루는 AI 연구자 및 엔지니어, 그리고 flash-linear-attention 프레임워크를 사용하여 최신 NVIDIA GPU에서 모델 추론 및 훈련 성능을 최적화하고자 하는 사용자를 대상으로 합니다.
주요 특징
- SM90+ GPU를 위한 CUTLASS 기반 고성능 커널.
- 자동 디스패치를 통한
flash-linear-attention라이브러리와의 원활한 통합. - 누적 시퀀스 길이(
cu_seqlens)를 사용한 가변 길이 배치 지원. - 상태 없는 및 상태 있는(초기/최종 상태) 순환 계산 모두 지원.
관련
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch
- 프로젝트