Tencent/hpc-ops

High Performance LLM Inference Operator Library

What it solves

HPC-Ops는 LLM 추론에서 발생하는 레이턴시와 처리량 병목 현상을 해결합니다. 서비스의 "핫 경로"—예를 들어 어텐션, Mixture‑of‑Experts(MoE), 샘플링—에 초점을 맞추며, 표준 구현이 메모리 대역폭 제한, 비효율적인 작업 스케줄링, 과도한 커널 실행 오버헤드에 의해 성능이 저하되는 문제를 개선합니다.

How it works

현대 NVIDIA GPU(SM90)를 위해 특별히 최적화된 프로덕션 급 CUDA 커널 라이브러리를 제공합니다. 하드웨어 활용도를 극대화하기 위해 다음과 같은 고급 기술을 적용했습니다:

  • Dynamic Scheduling: 디코드 어텐션에 대해 탐욕적인 bin‑packing 전략을 사용해 워크로드를 컴퓨트 유닛에 고르게 분배하고, 가변 길이 요청의 테일 레이턴시를 감소시킵니다.
  • Operator Fusion: 여러 연산을 단일 커널로 합칩니다. 예를 들어 AllReduce, residual addition, RMSNorm을 NVLink‑네이티브 커널 하나로 결합하고, penalty, temperature, top‑k/p, softmax으로 구성된 전체 샘플링 파이프라인을 두 개의 커널로 통합합니다.
  • Precision Optimization: FP8 및 BF16 전용 커널을 구현하고, 두 개의 BF16 Tensor Core GEMM을 융합한 "Route GEMM"을 통해 FP32 수준의 정확도를 달성합니다.
  • Pipelined Execution: Fused MoE 경로는 routing, GEMM, reduction을 하나의 파이프라인으로 통합해 독립적인 gather 단계를 제거하고 메모리 트래픽을 감소시킵니다.

Who it’s for

이 라이브러리는 AI 인프라 엔지니어와 개발자를 위해 설계되었습니다. 특히 vLLM이나 SGLang과 같은 고성능 LLM 추론 프레임워크를 구축하는 팀이 NVIDIA H20 GPU에서 최대 성능을 끌어내야 할 때 유용합니다.

Highlights

  • SOTA Performance: FlashInfer 및 TensorRT‑LLM 등 기존 베이스라인을 능가하며, fused sampling에서는 최대 8.5배 속도 향상을 달성합니다.
  • Rich Precision Support: BF16 및 FP8을 네이티브로 지원하고 다양한 양자화 스킴을 제공합니다.
  • Production‑Proven: Tencent Hunyuan AI Infra 팀이 대규모 프로덕션 추론을 위해 개발하고 검증했습니다.
  • Modern CUDA Implementation: CuTe, CUTLASS, TMA, PDL 등 최신 기능을 활용합니다.