flashinfer-ai/flashinfer

FlashInfer: Kernel Library for LLM Serving

해결하는 문제

FlashInfer는 LLM 추론의 성능 저하를 해결하기 위해 고도로 최적화된 GPU 커널을 제공합니다. 특히 어텐션 메커니즘, 행렬 곱셈(GEMM), 혼합 전문가(MoE) 연산에서의 비효율성을 집중적으로 해결하며, Turing에서 Blackwell에 이르는 다양한 NVIDIA GPU 아키텍처에서 높은 처리량과 낮은 지연을 보장합니다.

작동 방식

이것은 핵심 AI 연산을 위한 통합 API를 제공하는 라이브러리이자 커널 생성기입니다. 사용자의 하드웨어와 특정 워크로드에 따라 가장 효율적인 백엔드 구현(예: FlashAttention-2/3, cuDNN, CUTLASS, TensorRT-LLM)을 자동으로 선택합니다. 페이지 기반 및 래그드 KV 캐시와 같은 고급 메모리 관리, 그리고 저정밀도 계산(FP8 및 FP4)을 지원하여 성능을 더욱 향상시킵니다.

대상 사용자

이 프로젝트는 vLLM 또는 SGLang과 같은 고성능 LLM 서빙 프레임워크를 개발하는 개발자와 추론 작업에 최신 GPU 가속을 필요로 하는 연구자에게 적합합니다.

주요 특징

  • 광범위한 아키텍처 지원: SM75(Turing)부터 최신 Blackwell(SM100+) 아키텍처까지 최적화되어 있습니다.
  • 고급 어텐션: DeepSeek의 Multi-Latent Attention(MLA), Cascade Attention, 그리고 스파스 어텐션 패턴을 네이티브로 지원합니다.
  • 최적화된 MoE: 다양한 라우팅 방법과 양자화된 가중치를 지원하는 혼합 전문가용 융합 커널.
  • 저정밀도 계산: GEMM 및 MoE 연산에 대한 FP8 및 FP4 양자화를 지원합니다.
  • 생산 준비 완료: CUDAGraph 및 torch.compile과 호환되어 최소한의 서빙 지연을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트