flashinfer-ai/flashinfer
FlashInfer: Kernel Library for LLM Serving
何を解決するか
FlashInfer は LLM 推論におけるパフォーマンスのボトルネックを克服するために、高度に最適化された GPU カーネルを提供します。特に、アテンション機構、行列乗算(GEMM)、および Mixture of Experts(MoE)演算における非効率性に焦点を当てており、Turing から Blackwell に至る幅広い NVIDIA GPU アーキテクチャで高スループットかつ低レイテンシを実現します。
動作方法
これは、重要な AI 演算のための統一された API を提供するライブラリおよびカーネル生成器です。ユーザーのハードウェアと特定のワークロードに基づいて、最も効率的なバックエンド実装(例:FlashAttention-2/3、cuDNN、CUTLASS、TensorRT-LLM)を自動的に選択します。ページ化およびラグド KV キャッシュなどの高度なメモリ管理、および低精度計算(FP8 および FP4)をサポートすることで、さらに高速化を実現します。
対象ユーザー
このプロジェクトは、vLLM や SGLang などの高性能 LLM サービングフレームワークを開発する開発者、および推論タスクに最先端の GPU 加速を必要とする研究者向けです。
主な特徴
- 広範なアーキテクチャ対応:SM75(Turing)から最新の Blackwell(SM100+)アーキテクチャまで最適化されています。
- 高度なアテンション:DeepSeek の Multi-Latent Attention(MLA)、Cascade Attention、およびスパースアテンションパターンをネイティブでサポート。
- 最適化された MoE:複数のルーティング方法と量子化された重みをサポートする Mixture of Experts 用の統合カーネル。
- 低精度計算:GEMM および MoE 演算における FP8 および FP4 量子化をサポート。
- プロダクション対応:CUDAGraph および
torch.compileと互換性があり、最小限のサービングレイテンシを実現。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト