Tencent/hpc-ops

High Performance LLM Inference Operator Library

何を解決するか

HPC-Ops は、大規模言語モデル(LLM)の推論におけるレイテンシを低減し、スループットを向上させるために設計された高性能オペレータライブラリです。このライブラリは、推論の「ホットパス」——最も計算負荷が高い演算——に焦点を当てており、生産環境での推論で頻繁に発生するボトルネックを解消します。

どう動くか

このライブラリは、最新のNVIDIA GPU(特にSM90/H20)に最適化されたCUDAカーネルのセットを提供します。いくつかの高度な技術を用いてパフォーマンスを向上させています:

  • 結合(Fusion):複数の演算を1つのカーネルに統合することで、メモリトラフィックとカーネル起動のオーバーヘッドを削減します。AllReduce、Residual Add、RMSNormの結合や、サンプリングパイプライン全体を2つのカーネルに圧縮する例があります。
  • 動的スケジューリング:デコードアテンションでは、計算ユニット間のワークロードをバランスさせるためのグリーディなビンパッキング戦略を使用し、長さが異なるリクエストの混合環境での尾遅延を低減します。
  • 精度最適化:BF16およびFP8をサポートしており、2つのBF16 Tensor Core GEMMの線形結合でFP32の精度をシミュレートする独自の「ルートGEMM」を実装しています。
  • スパース性:長文コンテキスト処理において、関係のないKVタイルをスキップするブロックスパースプレフィルアテンションを実装しています。

対象ユーザー

このライブラリは、vLLMやSGLangなどのLLM推論フレームワークを開発するAIインフラエンジニアや開発者向けです。NVIDIAハードウェア上で生産環境向けのSOTAパフォーマンスを必要とする方々に最適です。

主な特徴

  • 包括的なオペレータカタログ:Attention、MoE(Mixture of Experts)、GEMM、Sampling、Normalization用の最適化カーネルを含みます。
  • SOTAベンチマーク:FlashInfer、TensorRT-LLM、cuBLASなどのベースラインと比較して顕著な高速化を実現(例:統合サンプラーで最大8.5倍)。
  • 生産環境実績:Tencent Hunyuan AI Infraチームが大規模な生産用途のために開発しました。
  • 開発者向けリソース:CuTe、CUTLASS、TMAなどの現代的なCUDAツールを用いたカーネル開発の実践的ガイドとして活用できます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト