openinfer-project/openinfer

Pure Rust + CUDA LLM inference engine — no PyTorch, OpenAI-compatible, serves Qwen3 to Kimi-K2

解決的問題

openinfer 是一個高性能 LLM 推理引擎,旨在消除與 PyTorch 或 ONNX 等沉重模型框架執行階段相關的開銷。透過移除這些依賴項,它實現了顯著加快的冷啟動時間、更小的記憶體佔用,並降低了多輪對話與代理(agentic)工作流的延遲。

工作原理

該引擎完全使用 Rust 與 CUDA 构建,採用手寫內核與自定義調度器。它利用 CUDA Graphs 消除了解碼路徑上的內核啟動開銷,並採用分層 KV 快取系統(透過 openinfer-kv-offload),可以從主機 DRAM 恢復被驅逐的前綴,而不是重新計算它們。對於特定模型,它集成了 Triton AOT 內核、用於分頁注意力(paged attention)的 FlashInfer,以及用於多 GPU 通訊的 NCCL。

適用對象

構建生產級 LLM 服務的開發人員與工程師,他們需要針對大規模前沿模型實現極低的啟動延遲、低常駐記憶體佔用與高吞吐量,且不希望承受基於 Python 的執行階段負擔。

亮點

  • 零框架執行階段:無需 PyTorch 或 ONNX;預設構建採用純 Rust 與 CUDA。
  • 快速啟動:冷啟動約需 3 秒,而 vLLM 等框架的啟動時間要長得多。
  • 低記憶體佔用:閒置時的常駐記憶體佔用比 vLLM 小約 5 倍。
  • 前沿模型支援:支援包括 Qwen3、Qwen3.5、DeepSeek-V2-Lite 以及兆級參數的 Kimi-K2 在內的模型。
  • OpenAI 相容:提供 /v1/completions 端點以便於整合。