Tencent/hpc-ops

High Performance LLM Inference Operator Library

What it solves

HPC-Ops 解决了 LLM 推理中的延迟与吞吐瓶颈。它针对服务的“热路径”——例如注意力、Mixture‑of‑Experts(MoE)和采样——这些在标准实现中常因内存带宽限制、调度效率低下或过多的 kernel 启动开销而受限。

How it works

它提供一套面向生产环境的 CUDA 核心,专为现代 NVIDIA GPU(SM90)优化。项目采用了多项先进技术以最大化硬件利用率:

  • Dynamic Scheduling:对解码注意力使用贪婪的 bin‑packing 策略,平衡计算单元的工作负载,降低混合长度请求的尾部延迟。
  • Operator Fusion:将多个操作合并为单一 kernel。例如,将 AllReduce、残差相加与 RMSNorm 融合成一个 NVLink 原生 kernel,并将整个采样流程(penalty、temperature、top‑k/p、softmax)合并为两个 kernel。
  • Precision Optimization:实现 FP8 与 BF16 的专用 kernel,包括一个“Route GEMM”——通过融合两个 BF16 Tensor Core GEMM 的线性组合,达到 FP32 级别的精度。
  • Pipelined Execution:Fused MoE 路径将 routing、GEMM 与 reduction 整合为单一流水线,去除独立的 gather 阶段以减少内存流量。

Who it’s for

此库设计给 AI 基础设施工程师与开发者,尤其是构建高性能 LLM 推理框架(如 vLLM 或 SGLang)的团队,需要在 NVIDIA H20 GPU 上榨取最大性能。

Highlights

  • SOTA Performance:在各种场景下超越 FlashInfer 与 TensorRT‑LLM 等基线,融合采样最高可达 8.5 倍加速。
  • Rich Precision Support:原生支持 BF16 与 FP8,并提供多种量化方案。
  • Production‑Proven:由 Tencent Hunyuan AI Infra 团队开发,已在大规模生产推理中验证。
  • Modern CUDA Implementation:利用 CuTe、CUTLASS、TMA、PDL 等前沿特性。