Tencent/hpc-ops
High Performance LLM Inference Operator Library
解决的问题
HPC-Ops 是一个专为降低大语言模型(LLM)推理延迟并提升吞吐量而设计的高性能操作符库。它聚焦于推理的“热路径”——计算开销最大的操作——这些操作在生产服务环境中常常成为性能瓶颈。
如何工作
该库提供一系列针对现代 NVIDIA GPU(特别是 SM90/H20)深度优化的 CUDA 内核。通过多种先进技术实现性能提升:
- 融合(Fusion):将多个操作合并为单个内核,以减少内存流量和内核启动开销。例如,融合 AllReduce、残差加法和 RMSNorm,或将整个采样流水线压缩为两个内核。
- 动态调度:对于解码注意力,采用贪心的装箱策略在计算单元间均衡负载,降低混合长度请求的尾延迟。
- 精度优化:支持 BF16 和 FP8,包括一种独特的“路由 GEMM”,通过两个 BF16 Tensor Core GEMM 的线性组合模拟 FP32 精度。
- 稀疏性:实现块稀疏预填充注意力,跳过长上下文任务中无关的 KV 块。
适用人群
该库适用于构建 LLM 推理框架(如 vLLM 或 SGLang)的 AI 基础设施工程师和开发者,需要在 NVIDIA 硬件上实现生产级、SOTA 性能的用户。
主要亮点
- 全面的操作符目录:包含 Attention、MoE(专家混合)、GEMM、采样和归一化等优化内核。
- SOTA 基准测试:在 FlashInfer、TensorRT-LLM 和 cuBLAS 等基线之上实现显著加速(例如,融合采样器最高达 8.5 倍)。
- 生产环境验证:由腾讯混元 AI 基础设施团队为大规模生产环境开发。
- 开发者资源:作为使用现代 CUDA 工具(如 CuTe、CUTLASS 和 TMA)构建内核的实用指南。
相关
- 项目
- 项目
- 项目
- 项目
- 项目