guoqingbao/xinfer
Blazing-fast LLM inference in pure Rust. No PyTorch and Python runtime.
解決的問題
xInfer 是一個高效率的 LLM 推論引擎,旨在消除 Python 與 PyTorch 的開銷。它提供一個可移植、生產就緒的環境,以極小的記憶體佔用與高吞吐量運行大型模型,特別針對在消費級 GPU 上執行大型 MoE(專家混合)模型的能力。
工作原理
xInfer 完全以 Rust 編寫,實現原生後端,跳過 Python 執行時。它運用先進的優化技術,包括原生 Flash Attention、FlashInfer、CUDA Graphs 與連續批次處理。為應對記憶體限制,它使用「TurboQuant」(2–4 位 KV 快取壓縮),並支援 NVFP4、FP8 與 GGUF 等多種量化格式。同時支援 Prefill-Decode Disaggregation,允許將提示處理(prefill)與詞元生成(decode)分攤至不同 GPU 或機器,以避免停頓。
適用對象
適合需要快速、輕量且跨平台(Linux、Windows、macOS)推論伺服器的開發者與運維人員,相容 OpenAI 與 Anthropic API,也適合希望在硬體受限環境下部署大型模型的使用者。
主要亮點
- 零 Python 依賴:純 Rust 後端,提升可移植性與效能。
- 激進的 KV 壓縮:TurboQuant 可將上下文長度擴展至 4.3 倍,使 30B+ 模型可在單一 24/32 GB GPU 上執行。
- 廣泛模型支援:相容 Llama、Qwen、Mistral、GLM、DeepSeek、Phi 與 Gemma,包含多模態版本。
- 生產級功能:內建 ChatGPT 風格 Web UI、MCP 工具呼叫與透過引導解碼實現的結構化輸出。
- 多節點擴展:支援使用 TCP 基礎的 NCCL 啟動,在多台機器間進行張量平行,無需 MPI。
相關
- 專案
- 專案
- 專案
- 專案
- 專案