vllm-project/vllm-ascend
Community maintained hardware plugin for vLLM on Ascend
解决的问题
它使 vLLM 推理引擎能够在华为 Ascend NPU(神经网络处理器)上无缝运行。通过提供硬件可插拔接口,它将 Ascend NPU 的集成与 vLLM 核心代码库解耦,允许用户在不修改主引擎的情况下,在 Ascend 硬件上部署高性能 LLM。
工作原理
该项目作为一个社区维护的硬件插件运行。它实现了一个可插拔接口(基于特定 RFC),允许 vLLM 与 Ascend 硬件进行通信。通过使用 CANN 软件栈和 PyTorch,这使得支持包括类 Transformer 模型、混合专家模型 (MoE)、嵌入模型 (Embedding models) 和多模态 LLM 在内的各种模型架构成为可能。
适用对象
拥有 Ascend NPU 硬件(如 Atlas 800I 或 Atlas A2/A3 系列)并希望使用 vLLM 进行高效模型推理和部署的开发人员和研究人员。
亮点
- 广泛的模型支持:兼容 Transformer、MoE、Embedding 和多模态 LLM。
- 硬件可插拔性:将硬件集成与 vLLM 核心引擎解耦,便于维护。
- 企业级硬件支持:专门针对 Atlas 800I 和 Atlas A2/A3 系列 NPU 进行了优化。
- 社区驱动:作为插件进行维护,以确保与 vLLM 的主发布周期保持兼容。