pegainfer-project/pegainfer
Pure Rust + CUDA LLM inference engine — no PyTorch, OpenAI-compatible, serves Qwen3 to Kimi-K2
解決的問題
PegaInfer 是一個高效率的 LLM 推論引擎,專為消除 PyTorch 或 ONNX 等重型模型框架執行時所帶來的開銷而設計。透過移除這些依賴,它相比傳統推論框架實現了顯著更快的冷啟動時間與更小的記憶體佔用。
工作原理
此引擎完全以 Rust 和 CUDA 建構,包含手寫的內核與排程器。採用 GPU 優先的執行環境,模型執行維持在原生路徑中。主要技術實作包括:
- 自訂內核:在解碼關鍵路徑使用 CUDA,特定模型相容性使用 Triton AOT,分頁注意力與取樣使用 FlashInfer,矩陣乘法使用 cuBLAS。
- CUDA Graphs:於 Qwen 解碼路徑中使用,以消除內核啟動開銷。
- KV 管理:實作 KV 快取與主機層級還原系統(pegaflow),允許被驅逐的前置詞從主機 DRAM 恢復,而非重新計算。
- 多 GPU 支援:整合 NCCL 用於歸約,並使用 DeepEP 介面層支援特定模型架構。
適用對象
需要生產級、輕量級推論伺服器,啟動延遲極低且常駐記憶體使用量小的開發者與工程師,特別是部署前沿規模模型(如 Qwen 和 Kimi)的使用者。
主要亮點
- 零框架依賴:執行時無需 PyTorch 或 ONNX。
- 快速啟動:從冷啟動到 HTTP 就緒僅需約 3 秒,相比 vLLM 的約 70 秒大幅提升。
- 低記憶體佔用:相比 vLLM,常駐記憶體佔用約小 5GB。
- 廣泛模型支援:支援 Qwen3、Qwen3.5、DeepSeek-V2-Lite、Kimi-K2 與 GLM-5.2。
- OpenAI 兼容:提供
/v1/completions與/v1/chat/completions端點。
相關
- 專案
- 專案
- 專案
- 專案
- 專案