cursor/mixture-of-kittens
Mixture-of-experts (MoE) training megakernel for NVL72s
해결하는 문제
Mixture-of-Kittens (MoK)는 고성능 NVIDIA Blackwell NVL72 시스템에서 Mixture-of-Experts (MoE) 모델을 훈련할 때 발생하는 효율성 저하 문제를 해결합니다. 특히 CPU-GPU 동기화로 인한 오버헤드와 MoE 훈련 중 계산과 통신이 분리되어 발생하는 지연을 타겟으로 하며, 이는 훈련 속도를 저하시킬 수 있습니다.
작동 방식
MoK는 모든 MoE 계산과 통신을 하나의 CUDA 커널에 융합하는 결정론적 '메가커널'입니다. 이를 통해 계산과 GPU 간 네트워킹을 설정 가능한 세부 단위로 겹쳐서 CPU-GPU 동기화가 완전히 필요 없도록 합니다. BF16 및 MXFP8 정밀도 형식을 지원하며, 순방향 및 역방향 전파 모두를 처리할 수 있습니다.
대상 사용자
이 프로젝트는 NVIDIA Blackwell GPU(SM100 또는 SM103)와 대규모 MoE 훈련에 종사하는 연구자 및 엔지니어를 위한 것입니다. 예를 들어, 프로덕션 수준의 LLM을 훈련하는 사람들에게 적합합니다.
주요 특징
- 고성능: 가장 빠른 기준 대비 MXFP8 순방향에서 최대 2.37배 빠르고, BF16 순방향에서 최대 1.92배 빠릅니다.
- 융합 커널: 계산과 통신을 하나의 연산으로 통합하여 하드웨어 활용도를 극대화합니다.
- 정밀도 지원: 최적화된 훈련을 위한 BF16 및 MXFP8을 지원합니다.
- 이중 레이어 API: 직접 CUDA 커널 호출에 적합한 저수준 'Ops 레이어'와 생산 환경 통합이 쉬운 고수준 'Functional 레이어'를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트