Tencent/hpc-ops

High Performance LLM Inference Operator Library

What it solves

HPC-Ops 解決了 LLM 推理中的延遲與吞吐瓶頸。它針對服務的「熱路徑」——例如注意力、Mixture‑of‑Experts(MoE)與抽樣——這些在標準實作中常因記憶體頻寬限制、排程效率低下或過多的 kernel 啟動開銷而受限。

How it works

它提供一套面向生產環境的 CUDA 核心,專為現代 NVIDIA GPU(SM90)優化。專案採用了多項先進技術以最大化硬體利用率:

  • Dynamic Scheduling:對解碼注意力使用貪婪的 bin‑packing 策略,平衡計算單元的工作負載,降低混合長度請求的尾端延遲。
  • Operator Fusion:將多個操作合併為單一 kernel。例如,將 AllReduce、殘差相加與 RMSNorm 融合成一個 NVLink 原生 kernel,並將整個抽樣流程(penalty、temperature、top‑k/p、softmax)合併為兩個 kernel。
  • Precision Optimization:實作 FP8 與 BF16 的專用 kernel,包括一個「Route GEMM」——透過融合兩個 BF16 Tensor Core GEMM 的線性組合,達到 FP32 級別的精度。
  • Pipelined Execution:Fused MoE 路徑將 routing、GEMM 與 reduction 整合為單一流水線,去除獨立的 gather 階段以減少記憶體流量。

Who it’s for

此庫設計給 AI 基礎設施工程師與開發者,尤其是構建高效能 LLM 推理框架(如 vLLM 或 SGLang)的團隊,需要在 NVIDIA H20 GPU 上榨取最大效能。

Highlights

  • SOTA Performance:在各種情境下超越 FlashInfer 與 TensorRT‑LLM 等基線,融合抽樣最高可達 8.5 倍加速。
  • Rich Precision Support:原生支援 BF16 與 FP8,並提供多種量化方案。
  • Production‑Proven:由 Tencent Hunyuan AI Infra 團隊開發,已在大規模生產推理中驗證。
  • Modern CUDA Implementation:利用 CuTe、CUTLASS、TMA、PDL 等前沿特性。