vllm-project/vllm-ascend
Community maintained hardware plugin for vLLM on Ascend
解決的問題
讓 vLLM 推理引擎能在華為 Ascend NPU 上順暢運行,透過可插入式介面將硬體整合與 vLLM 核心程式碼庫分離。
工作原理
作為一個硬體插件,實作特定介面(基於硬體可插入 RFC)來橋接 vLLM 的需求與 Ascend NPU 架構。這使得多種模型類型——包括基於 Transformer 的 LLM、專家混合模型(MoE)、嵌入模型以及多模態 LLM——都能在 Ascend 硬體上執行。
適用對象
使用華為 Ascend 硬體(如 Atlas 800I 或 Atlas A2/A3 系列)並希望使用 vLLM 框架部署高效率 LLM 推論的開發者與 AI 工程師。
主要特色
- 支援廣泛的模型架構,包括 MoE 與多模態 LLM。
- 遵循硬體可插入架構,保持主 vLLM 項目乾淨。
- 相容 CANN 9.1.0 及特定版本的 PyTorch/TorchNPU。
- 社群維護,提供多種 Atlas NPU 系列的專用支援。
相關
- 專案
baidu/vLLM-KunlunA hardware plugin that enables vLLM to run on Kunlun XPU, providing optimized kernels and support for a wide range of LLMs and multimodal models.
- 專案
guqiong96/LvllmvLLM 的擴展,支援 MoE 模型在 VRAM 與系統記憶體之間進行混合 GPU 與 NUMA 感知 CPU 推理,優化記憶體使用。
- 專案
ztxz16/fastllm一個高效能的 C++ LLM 推理引擎,能在 GPU、CPU、NUMA 和磁碟之間實現稠密與 MoE 模型的混合部署,以最大化硬體使用率。
- 專案
xLLM-AI/xllmxLLM 是一個開源 C++ 推理框架,可在 Ascend、Cambricon、Moore Threads 等中國AI加速器上實現高吞吐、低延遲的 LLM 服務。它將基於 brpc 的服務層與硬體優化引擎分離,整合 Mooncake 實現混合 KV 快取管理,並為 GLM-5.3-Flash 和 MiniMax-M3 等模型提供即時可用的部署腳本。專案採用 Apache-2.0 許可證,由 JD.com 及多家中國大學實驗室支援。
- 專案