Tencent/hpc-ops

High Performance LLM Inference Operator Library

解決的問題

HPC-Ops 是一個專為降低大型語言模型(LLM)推論延遲並提升吞吐量而設計的高性能運算子庫。它專注於推論的「熱路徑」——計算成本最高的運算——這些運算在實際生產服務環境中經常成為瓶頸。

如何運作

該庫提供一系列針對現代 NVIDIA GPU(特別是 SM90/H20)深度優化的 CUDA 內核。透過多種先進技術實現性能提升:

  • 融合(Fusion):將多個運算合併為單一內核,以減少記憶體流量與內核啟動開銷。例如,融合 AllReduce、殘差加法與 RMSNorm,或將整個取樣流程壓縮為兩個內核。
  • 動態排程:針對解碼注意力,採用貪心的箱型打包策略,在計算單元間平衡負載,降低混合長度請求的尾部延遲。
  • 精度優化:支援 BF16 與 FP8,包含獨特的「路由 GEMM」,透過兩個 BF16 Tensor Core GEMM 的線性組合模擬 FP32 精度。
  • 稀疏性:實作區塊稀疏預填注意力,跳過長上下文工作負載中無關的 KV 塊。

適用對象

此庫適用於開發 LLM 推論框架(如 vLLM 或 SGLang)的 AI 基礎設施工程師與開發者,需要在 NVIDIA 硬體上實現生產級、SOTA 性能的使用者。

主要亮點

  • 全面的運算子目錄:包含 Attention、MoE(專家混合)、GEMM、取樣與歸一化等優化內核。
  • SOTA 基準測試:在 FlashInfer、TensorRT-LLM 與 cuBLAS 等基線之上實現顯著加速(例如,融合取樣器最高達 8.5 倍)。
  • 生產環境驗證:由騰訊混元 AI 基礎設施團隊為大規模生產環境開發。
  • 開發者資源:作為使用現代 CUDA 工具(如 CuTe、CUTLASS 與 TMA)建構內核的實用指南。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案