flashinfer-ai/flashinfer

FlashInfer: Kernel Library for LLM Serving

何を解決するか

FlashInfer は LLM 推論におけるパフォーマンスのボトルネックを克服するために、高度に最適化された GPU カーネルを提供します。特に、アテンション機構、行列乗算(GEMM)、および Mixture of Experts(MoE)演算における非効率性に焦点を当てており、Turing から Blackwell に至る幅広い NVIDIA GPU アーキテクチャで高スループットかつ低レイテンシを実現します。

動作方法

これは、重要な AI 演算のための統一された API を提供するライブラリおよびカーネル生成器です。ユーザーのハードウェアと特定のワークロードに基づいて、最も効率的なバックエンド実装(例:FlashAttention-2/3、cuDNN、CUTLASS、TensorRT-LLM)を自動的に選択します。ページ化およびラグド KV キャッシュなどの高度なメモリ管理、および低精度計算(FP8 および FP4)をサポートすることで、さらに高速化を実現します。

対象ユーザー

このプロジェクトは、vLLM や SGLang などの高性能 LLM サービングフレームワークを開発する開発者、および推論タスクに最先端の GPU 加速を必要とする研究者向けです。

主な特徴

  • 広範なアーキテクチャ対応:SM75(Turing)から最新の Blackwell(SM100+)アーキテクチャまで最適化されています。
  • 高度なアテンション:DeepSeek の Multi-Latent Attention(MLA)、Cascade Attention、およびスパースアテンションパターンをネイティブでサポート。
  • 最適化された MoE:複数のルーティング方法と量子化された重みをサポートする Mixture of Experts 用の統合カーネル。
  • 低精度計算:GEMM および MoE 演算における FP8 および FP4 量子化をサポート。
  • プロダクション対応:CUDAGraph および torch.compile と互換性があり、最小限のサービングレイテンシを実現。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト