vllm-project/vllm-ascend

Community maintained hardware plugin for vLLM on Ascend

解决的问题

使 vLLM 推理引擎能够在华为 Ascend NPU 上无缝运行,通过可插拔接口将硬件集成与 vLLM 核心代码库解耦。

工作原理

作为一个硬件插件,实现特定接口(基于硬件可插拔 RFC)来连接 vLLM 的需求与 Ascend NPU 架构。这使得多种模型类型——包括基于 Transformer 的 LLM、专家混合模型(MoE)、嵌入模型以及多模态 LLM——都能在 Ascend 硬件上运行。

适用人群

使用华为 Ascend 硬件(如 Atlas 800I 或 Atlas A2/A3 系列)并希望使用 vLLM 框架部署高性能 LLM 推理的开发者和 AI 工程师。

主要亮点

  • 支持广泛的模型架构,包括 MoE 和多模态 LLM。
  • 遵循硬件可插拔架构,保持主 vLLM 项目代码整洁。
  • 兼容 CANN 9.1.0 及特定版本的 PyTorch/TorchNPU。
  • 社区维护,为多种 Atlas NPU 系列提供专用支持。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目