mudler/vllm.cpp
a community oriented 1:1, vLLM-alike (Continuous batching, paged KV) engine in C++ with additional features (GGUF, RadixAttention, Cache-aware scheduling, ...)
它解决了什么问题
vllm.cpp 是一个高性能的 C++20 推理引擎,旨在提供 vLLM 的服务功能,同时避免 Python 和 PyTorch 的庞大依赖。它力求实现最小的部署体积(单个 66 MiB 二进制文件),同时保持原始 vLLM 项目的吞吐量和功能集。
它如何工作
该引擎结合了多个领先推理框架的最佳特性:
- vLLM Core:实现连续批处理、块页式 KV 缓存和自动前缀缓存。
- SGLang:集成 RadixAttention 和缓存感知调度。
- llama.cpp:采用扁平的 C ABI 以方便嵌入,并原生支持 GGUF 量化文件。
- 硬件加速:支持多种后端,包括 CUDA、CPU、Metal 和 Vulkan,且仅需一个源码树。
适合谁使用
适用于需要以最小开销部署大语言模型的开发者和运维人员,希望在无 Python 环境下获得 OpenAI 兼容端点的用户,以及在不同硬件(NVIDIA、Apple Silicon、便携式 GPU)上运行模型的用户。
主要亮点
- 极致轻量:66 MiB 二进制文件 vs vLLM 安装包的 9.1 GiB。
- 广泛的模型支持:支持 37 种注册架构,包括 Llama-3、Mistral、Qwen 和 DeepSeek。
- 多模态能力:支持图像、视频和音频输入,以及通过 MiniMax-H3 实现的视频和音频生成。
- 高性能:在特定模型上(如 Qwen3.6-27B)的吞吐量与 vLLM 相当或更优,并在 CPU 上优于 llama.cpp 的预填充性能。
- 灵活的量化支持:原生支持 GGUF 和 NVFP4。
- C ABI:提供版本化的 C ABI,可无缝集成到 C、C++、Go 或 Rust 应用中。
相关
- 项目
- 项目
- 项目
- 项目
- 项目