vllm-project/vllm-ascend
Community maintained hardware plugin for vLLM on Ascend
解决的问题
使 vLLM 推理引擎能够在华为 Ascend NPU 上无缝运行,通过可插拔接口将硬件集成与 vLLM 核心代码库解耦。
工作原理
作为一个硬件插件,实现特定接口(基于硬件可插拔 RFC)来连接 vLLM 的需求与 Ascend NPU 架构。这使得多种模型类型——包括基于 Transformer 的 LLM、专家混合模型(MoE)、嵌入模型以及多模态 LLM——都能在 Ascend 硬件上运行。
适用人群
使用华为 Ascend 硬件(如 Atlas 800I 或 Atlas A2/A3 系列)并希望使用 vLLM 框架部署高性能 LLM 推理的开发者和 AI 工程师。
主要亮点
- 支持广泛的模型架构,包括 MoE 和多模态 LLM。
- 遵循硬件可插拔架构,保持主 vLLM 项目代码整洁。
- 兼容 CANN 9.1.0 及特定版本的 PyTorch/TorchNPU。
- 社区维护,为多种 Atlas NPU 系列提供专用支持。
相关
- 项目
baidu/vLLM-KunlunA hardware plugin that enables vLLM to run on Kunlun XPU, providing optimized kernels and support for a wide range of LLMs and multimodal models.
- 项目
guqiong96/LvllmvLLM 的扩展,支持 MoE 模型在 VRAM 和系统内存之间进行混合 GPU 与 NUMA 感知 CPU 推理,优化内存使用。
- 项目
ztxz16/fastllm一个高性能的 C++ LLM 推理引擎,能够在 GPU、CPU、NUMA 和磁盘之间实现稠密与 MoE 模型的混合部署,以最大化硬件利用率。
- 项目
xLLM-AI/xllmxLLM 是一个开源 C++ 推理框架,可在 Ascend、Cambricon、Moore Threads 等中国AI加速器上实现高吞吐、低延迟的 LLM 服务。它将基于 brpc 的服务层与硬件优化引擎分离,集成 Mooncake 实现混合 KV 缓存管理,并为 GLM-5.3-Flash 和 MiniMax-M3 等模型提供开箱即用的部署脚本。项目采用 Apache-2.0 许可证,由 JD.com 及多家中国大学实验室支持。
- 项目