Tencent/hpc-ops
High Performance LLM Inference Operator Library
해결하는 문제
HPC-Ops는 대규모 언어 모델(LLM) 추론의 지연 시간을 줄이고 처리량을 높이기 위해 설계된 고성능 오퍼레이터 라이브러리입니다. 이 라이브러리는 추론의 '핫패스'(가장 계산 비용이 큰 연산)에 초점을 맞추며, 실제 서비스 환경에서 흔히 발생하는 성능 저하의 원인을 해결합니다.
작동 방식
이 라이브러리는 최신 NVIDIA GPU(SM90/H20)에 특화된 깊이 최적화된 CUDA 커널 세트를 제공합니다. 여러 고급 기술을 통해 성능 향상을 달성합니다:
- 퓨전(Fusion): 여러 연산을 단일 커널로 통합하여 메모리 트래픽과 커널 실행 오버헤드를 줄입니다. 예를 들어 AllReduce, Residual Add, RMSNorm을 결합하거나, 전체 샘플링 파이프라인을 두 개의 커널로 압축할 수 있습니다.
- 동적 스케줄링: 디코딩 어텐션에서는 계산 유닛 간 작업 부하를 균형 있게 분배하기 위해 그리디 비ン패킹 전략을 사용하여 길이가 다른 요청이 혼합된 환경에서 꼬리 지연을 줄입니다.
- 정밀도 최적화: BF16 및 FP8을 지원하며, 두 개의 BF16 Tensor Core GEMM의 선형 조합을 사용해 FP32 정밀도를 시뮬레이션하는 고유한 '라우트 GEMM'을 제공합니다.
- 희소성(Sparsity): 긴 컨텍스트 작업에서 관련 없는 KV 타일을 건너뛰는 블록 스parse 프리필 어텐션을 구현합니다.
대상 사용자
이 라이브러리는 vLLM이나 SGLang과 같은 LLM 추론 프레임워크를 개발하는 AI 인프라 엔지니어 및 개발자에게 적합합니다. NVIDIA 하드웨어에서 생산 환경용 SOTA 성능이 필요한 사용자를 위한 것입니다.
주요 특징
- 포괄적인 오퍼레이터 카탈로그: Attention, MoE(Mixture of Experts), GEMM, Sampling, Normalization용 최적화된 커널을 포함합니다.
- SOTA 벤치마크: FlashInfer, TensorRT-LLM, cuBLAS와 같은 기준 대비 뚜렷한 성능 향상을 보입니다 (예: 통합 샘플러에서 최대 8.5배).
- 생산 환경 검증: Tencent Hunyuan AI Infra 팀이 대규모 생산 환경에서 사용하기 위해 개발했습니다.
- 개발자 자료: CuTe, CUTLASS, TMA와 같은 현대적인 CUDA 도구를 사용한 커널 개발에 대한 실용적인 가이드 역할을 합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트