pegainfer-project/pegainfer

Pure Rust + CUDA LLM inference engine — no PyTorch, OpenAI-compatible, serves Qwen3 to Kimi-K2

解决的问题

PegaInfer 是一个高性能 LLM 推理引擎,旨在消除 PyTorch 或 ONNX 等重型模型框架运行时带来的开销。通过移除这些依赖项,它相比传统推理框架实现了显著更快的冷启动时间和更小的内存占用。

工作原理

该引擎完全使用 Rust 和 CUDA 构建,包含手写内核和调度器。采用 GPU 优先的运行时,模型执行保持在原生路径中。关键技术实现包括:

  • 自定义内核:在解码关键路径使用 CUDA,特定模型兼容性使用 Triton AOT,分页注意力和采样使用 FlashInfer,矩阵乘法使用 cuBLAS。
  • CUDA Graphs:在 Qwen 解码路径中使用,以消除内核启动开销。
  • KV 管理:实现 KV 缓存和主机层级恢复系统(pegaflow),允许被驱逐的前缀从主机 DRAM 恢复,而非重新计算。
  • 多 GPU 支持:集成 NCCL 用于归约操作,以及 DeepEP 模拟层用于特定模型架构。

适用人群

需要生产级、轻量级推理服务器,启动延迟极低且常驻内存使用量小的开发者和工程师,特别是部署前沿规模模型(如 Qwen 和 Kimi)的用户。

主要亮点

  • 零框架依赖:运行时无需 PyTorch 或 ONNX。
  • 快速启动:从冷启动到 HTTP 就绪仅需约 3 秒,相比 vLLM 的约 70 秒大幅提升。
  • 低内存占用:相比 vLLM,常驻内存占用约小 5GB。
  • 广泛模型支持:支持 Qwen3、Qwen3.5、DeepSeek-V2-Lite、Kimi-K2 和 GLM-5.2。
  • OpenAI 兼容:提供 /v1/completions/v1/chat/completions 端点。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目