guoqingbao/xinfer

Blazing-fast LLM inference in pure Rust. No PyTorch and Python runtime.

解决的问题

xInfer 是一个高性能的 LLM 推理引擎,旨在消除 Python 和 PyTorch 的开销。它提供了一个可移植的、生产就绪的环境,用于以极小的内存占用和高吞吐量运行大型模型,特别针对在消费级 GPU 上运行大型 MoE(专家混合)模型的能力。

工作原理

xInfer 完全使用 Rust 构建,实现了一个原生后端,绕过了 Python 运行时。它利用了包括原生 Flash Attention、FlashInfer、CUDA Graphs 和连续批处理在内的高级优化技术。为应对内存限制,它使用了「TurboQuant」(2–4 位 KV 缓存压缩),并支持 NVFP4、FP8 和 GGUF 等多种量化格式。它还支持 Prefill-Decode Disaggregation,允许将提示处理(prefill)和标记生成(decode)分摊到不同的 GPU 或机器上,以防止阻塞。

适用人群

适用于需要快速、轻量且跨平台(Linux、Windows、macOS)推理服务器的开发者和运维人员,兼容 OpenAI 和 Anthropic API,也适用于希望在硬件受限环境下部署大型模型的用户。

主要亮点

  • 零 Python 依赖:纯 Rust 后端,提升可移植性和性能。
  • 激进的 KV 压缩:TurboQuant 将上下文长度扩展至 4.3 倍,使 30B+ 模型可在单个 24/32 GB GPU 上运行。
  • 广泛模型支持:兼容 Llama、Qwen、Mistral、GLM、DeepSeek、Phi 和 Gemma,包括多模态版本。
  • 生产级功能:内置 ChatGPT 风格 Web UI、MCP 工具调用和通过引导解码实现的结构化输出。
  • 多节点扩展:支持使用基于 TCP 的 NCCL 启动在多台机器之间进行张量并行,无需 MPI。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目