Tencent/hpc-ops

High Performance LLM Inference Operator Library

What it solves

HPC-Ops は LLM 推論におけるレイテンシとスループットのボトルネックを解消します。サービスの「ホットパス」― 注意機構、Mixture‑of‑Experts(MoE)、サンプリング― に焦点を当て、標準実装がメモリ帯域幅の制限、非効率なタスクスケジューリング、過剰なカーネル起動オーバーヘッドに悩まされる問題を解決します。

How it works

最新の NVIDIA GPU(SM90)向けに特化して最適化された本番レベルの CUDA カーネル群を提供します。ハードウェア利用率を最大化するために、以下の先進技術を採用しています:

  • Dynamic Scheduling:デコード注意に対して貪欲な bin‑packing 戦略を用い、計算ユニット間でワークロードを均等化し、可変長リクエストのテールレイテンシを低減します。
  • Operator Fusion:複数の演算を単一カーネルに統合します。例として、AllReduce、残差加算、RMSNorm を NVLink ネイティブのカーネルに融合し、ペナルティ、温度、top‑k/p、softmax からなるサンプリングパイプライン全体を 2 つのカーネルにまとめます。
  • Precision Optimization:FP8 と BF16 用の専用カーネルを実装し、2 つの BF16 Tensor Core GEMM の線形結合を融合した「Route GEMM」により FP32 レベルの精度を実現します。
  • Pipelined Execution:Fused MoE パスは routing、GEMM、reduction を単一パイプラインに統合し、スタンドアロンの gather ステージを除去してメモリトラフィックを削減します。

Who it’s for

このライブラリは、AI インフラエンジニアや開発者、特に vLLM や SGLang のような高性能 LLM 推論フレームワークを構築するチーム向けです。NVIDIA H20 GPU から最大のパフォーマンスを引き出す必要がある方に最適です。

Highlights

  • SOTA Performance:FlashInfer や TensorRT‑LLM などのベンチマークを上回り、融合サンプリングで最大 8.5 倍の速度向上を実現。
  • Rich Precision Support:BF16 と FP8 をネイティブにサポートし、様々な量子化方式を提供。
  • Production‑Proven:Tencent Hunyuan AI Infra チームが大規模本番推論向けに開発・検証。
  • Modern CUDA Implementation:CuTe、CUTLASS、TMA、PDL といった最先端機能を活用。