openinfer-project/openinfer

Pure Rust + CUDA LLM inference engine — no PyTorch, OpenAI-compatible, serves Qwen3 to Kimi-K2

解决的问题

openinfer 是一个高性能 LLM 推理引擎,旨在消除与 PyTorch 或 ONNX 等沉重模型框架运行时相关的开销。通过移除这些依赖项,它实现了显著加快的冷启动时间、更小的内存占用,并降低了多轮对话和智能体(agentic)工作流的延迟。

工作原理

该引擎完全使用 Rust 和 CUDA 构建,采用手写内核和自定义调度器。它利用 CUDA Graphs 消除了解码路径上的内核启动开销,并采用分层 KV 缓存系统(通过 openinfer-kv-offload),可以从主机 DRAM 恢复被驱逐的前缀,而不是重新计算它们。对于特定模型,它集成了 Triton AOT 内核、用于分页注意力(paged attention)的 FlashInfer 以及用于多 GPU 通信的 NCCL。

适用对象

构建生产级 LLM 服务的开发人员和工程师,他们需要针对大规模前沿模型实现极低的启动延迟、低常驻内存占用和高吞吐量,且不希望承受基于 Python 的运行时的负担。

亮点

  • 零框架运行时:无需 PyTorch 或 ONNX;默认构建采用纯 Rust 和 CUDA。
  • 快速启动:冷启动约需 3 秒,而 vLLM 等框架的启动时间要长得多。
  • 低内存占用:空闲时的常驻内存占用比 vLLM 小约 5 倍。
  • 前沿模型支持:支持包括 Qwen3、Qwen3.5、DeepSeek-V2-Lite 以及万亿参数级的 Kimi-K2 在内的模型。
  • OpenAI 兼容:提供 /v1/completions 端点以便于集成。