mudler/vllm.cpp

a community oriented 1:1, vLLM-alike (Continuous batching, paged KV) engine in C++ with additional features (GGUF, RadixAttention, Cache-aware scheduling, ...)

解決的問題

vllm.cpp 是一個高效率的 C++20 推理引擎,旨在提供 vLLM 的服務能力,同時避免 Python 與 PyTorch 的沉重依賴。它力求成為最小的部署方案(單一 66 MiB 二進位檔),同時維持原始 vLLM 專案的吞吐量與功能集。

如何運作

該引擎結合了多個領先推論框架的最佳特性:

  • vLLM Core:實作連續批次處理、分頁 KV 快取與自動前綴快取。
  • SGLang:整合 RadixAttention 與快取感知排程。
  • llama.cpp:採用平坦的 C ABI 以利嵌入,並原生支援 GGUF 量化檔案。
  • 硬體加速:從單一原始碼樹支援廣泛的後端,包括 CUDA、CPU、Metal 與 Vulkan。

適用對象

適合需要以最小開銷部署大型語言模型的開發者與運維人員,也適合希望在無 Python 環境下提供 OpenAI 兼容端點的使用者,以及在多樣硬體(NVIDIA、Apple Silicon、便攜式 GPU)上運行模型的用戶。

主要特色

  • 極致輕量:66 MiB 二進位檔 vs 9.1 GiB 的 vLLM 安裝大小。
  • 廣泛的模型支援:支援 37 種註冊架構,包含 Llama-3、Mistral、Qwen 與 DeepSeek。
  • 多模態能力:支援影像、影片與音訊輸入,並透過 MiniMax-H3 支援影片與音訊生成。
  • 高效率表現:在特定模型上(例如 Qwen3.6-27B)的吞吐量與 vLLM 相當或更優,且在 CPU 上的預填入表現超越 llama.cpp。
  • 彈性量化:原生支援 GGUF 與 NVFP4。
  • C ABI:提供版本化的 C ABI,可輕鬆整合至 C、C++、Go 或 Rust 應用程式中。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案