flashinfer-ai/flashinfer

FlashInfer: Kernel Library for LLM Serving

解決的問題

FlashInfer 透過提供高度優化的 GPU 內核,解決了 LLM 推論中的效能瓶頸。它特別針對注意力機制、矩陣乘法(GEMM)以及混合專家(MoE)運算中的低效率問題,確保在從 Turing 到 Blackwell 的廣泛 NVIDIA GPU 架構上實現高吞吐量與低延遲。

工作原理

它作為一個函式庫與內核產生器,為關鍵 AI 運算提供統一的 API。根據使用者的硬體與特定工作負載,自動選擇最高效的後端實作(例如 FlashAttention-2/3、cuDNN、CUTLASS 或 TensorRT-LLM)。支援進階記憶體管理(如分頁與稀疏 KV 快取)以及低精度運算(FP8 與 FP4),進一步提升速度。

適用對象

此專案適用於開發高效率 LLM 服務框架(如 vLLM 或 SGLang)的開發者,以及需要先進 GPU 加速進行推論任務的研究人員。

主要亮點

  • 廣泛的架構支援:針對 SM75(Turing)至最新 Blackwell(SM100+)架構進行優化。
  • 先進的注意力:原生支援 DeepSeek 的多隱式注意力(MLA)、級聯注意力與稀疏注意力模式。
  • 優化的 MoE:為混合專家提供融合內核,支援多種路由方法與量化權重。
  • 低精度運算:支援 GEMM 與 MoE 運算的 FP8 與 FP4 量化。
  • 生產就緒:與 CUDAGraph 和 torch.compile 相容,實現最小的服務延遲。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案