flashinfer-ai/flashinfer

FlashInfer: Kernel Library for LLM Serving

解决的问题

FlashInfer 通过提供高度优化的 GPU 内核,解决了 LLM 推理中的性能瓶颈。它特别针对注意力机制、矩阵乘法(GEMM)以及混合专家(MoE)操作中的低效问题,确保在从 Turing 到 Blackwell 的广泛 NVIDIA GPU 架构上实现高吞吐量和低延迟。

工作原理

它作为一个库和内核生成器,为关键 AI 操作提供统一的 API。根据用户的硬件和特定工作负载,自动选择最高效的后端实现(如 FlashAttention-2/3、cuDNN、CUTLASS 或 TensorRT-LLM)。它支持高级内存管理(如分页和稀疏 KV 缓存)以及低精度计算(FP8 和 FP4),以进一步提升速度。

适用人群

该项目适用于构建高性能 LLM 服务框架(如 vLLM 或 SGLang)的开发者,以及需要最先进的 GPU 加速进行推理任务的研究人员。

主要亮点

  • 广泛的架构支持:针对 SM75(Turing)至最新 Blackwell(SM100+)架构进行了优化。
  • 先进的注意力机制:原生支持 DeepSeek 的多隐式注意力(MLA)、级联注意力和稀疏注意力模式。
  • 优化的 MoE:为混合专家提供融合内核,支持多种路由方法和量化权重。
  • 低精度计算:支持 GEMM 和 MoE 操作的 FP8 和 FP4 量化。
  • 生产就绪:与 CUDAGraph 和 torch.compile 兼容,实现最小的推理延迟。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目