pegainfer-project/pegainfer

Pure Rust + CUDA LLM inference engine — no PyTorch, OpenAI-compatible, serves Qwen3 to Kimi-K2

해결하는 문제

PegaInfer는 PyTorch나 ONNX와 같은 무거운 모델 프레임워크 런타임의 오버헤드를 제거하기 위해 설계된 고성능 LLM 추론 엔진입니다. 이러한 종속성을 제거함으로써 전통적인 추론 프레임워크에 비해 훨씬 빠른 콜드 스타트 시간과 훨씬 작은 메모리 사용량을 달성합니다.

작동 방식

엔진은 완전히 Rust와 CUDA로 구현되었으며, 수작업으로 작성된 커널과 스케줄러를 갖추고 있습니다. 모델 실행은 네이티브 경로에 머무르는 GPU 우선 런타임을 사용합니다. 주요 기술적 구현은 다음과 같습니다:

  • 사용자 정의 커널: 디코딩 핵심 경로에는 CUDA, 특정 모델 호환성을 위해 Triton AOT, 페이지화된 어텐션과 샘플링에는 FlashInfer, 행렬 곱셈에는 cuBLAS를 사용합니다.
  • CUDA Graphs: Qwen 디코딩 경로에서 커널 시작 오버헤드를 제거하기 위해 사용됩니다.
  • KV 관리: KV 캐시와 호스트 계층 복원 시스템(pogaflow)을 구현하여, 제거된 프리픽스를 다시 계산하는 대신 호스트 DRAM에서 복원할 수 있습니다.
  • 다중 GPU 지원: 리덕션에는 NCCL을 통합하고, 특정 모델 아키텍처에는 DeepEP 쉴을 사용합니다.

대상 사용자

Qwen과 Kimi와 같은 프론티어 규모 모델을 제공하는 개발자 및 엔지니어. 최소한의 시작 지연과 낮은 상주 메모리 사용량을 필요로 하는 프로덕션 수준의 가벼운 추론 서버를 원하는 분들입니다.

주요 특징

  • 프레임워크 의존성 없음: 런타임에 PyTorch나 ONNX가 필요하지 않습니다.
  • 빠른 시작: 콜드 스타트에서 HTTP 준비 상태까지 약 3초. vLLM의 약 70초와 비교됩니다.
  • 낮은 사용량: vLLM보다 약 5GB 적은 상주 메모리 사용량을 제공합니다.
  • 광범위한 모델 지원: Qwen3, Qwen3.5, DeepSeek-V2-Lite, Kimi-K2, GLM-5.2를 지원합니다.
  • OpenAI 호환성: /v1/completions/v1/chat/completions 엔드포인트를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트