guoqingbao/xinfer
Blazing-fast LLM inference in pure Rust. No PyTorch and Python runtime.
解决的问题
xInfer 是一个高性能的 LLM 推理引擎,旨在消除 Python 和 PyTorch 的开销。它提供了一个可移植的、生产就绪的环境,用于以极小的内存占用和高吞吐量运行大型模型,特别针对在消费级 GPU 上运行大型 MoE(专家混合)模型的能力。
工作原理
xInfer 完全使用 Rust 构建,实现了一个原生后端,绕过了 Python 运行时。它利用了包括原生 Flash Attention、FlashInfer、CUDA Graphs 和连续批处理在内的高级优化技术。为应对内存限制,它使用了「TurboQuant」(2–4 位 KV 缓存压缩),并支持 NVFP4、FP8 和 GGUF 等多种量化格式。它还支持 Prefill-Decode Disaggregation,允许将提示处理(prefill)和标记生成(decode)分摊到不同的 GPU 或机器上,以防止阻塞。
适用人群
适用于需要快速、轻量且跨平台(Linux、Windows、macOS)推理服务器的开发者和运维人员,兼容 OpenAI 和 Anthropic API,也适用于希望在硬件受限环境下部署大型模型的用户。
主要亮点
- 零 Python 依赖:纯 Rust 后端,提升可移植性和性能。
- 激进的 KV 压缩:TurboQuant 将上下文长度扩展至 4.3 倍,使 30B+ 模型可在单个 24/32 GB GPU 上运行。
- 广泛模型支持:兼容 Llama、Qwen、Mistral、GLM、DeepSeek、Phi 和 Gemma,包括多模态版本。
- 生产级功能:内置 ChatGPT 风格 Web UI、MCP 工具调用和通过引导解码实现的结构化输出。
- 多节点扩展:支持使用基于 TCP 的 NCCL 启动在多台机器之间进行张量并行,无需 MPI。
相关
- 项目
- 项目
- 项目
- 项目
- 项目