vllm-project/vllm-ascend
Community maintained hardware plugin for vLLM on Ascend
解決的問題
它讓 vLLM 推理引擎能在華為 Ascend NPU(神經網路處理單元)上無縫運行。透過提供硬體可插拔介面,它將 Ascend NPU 的整合與 vLLM 核心程式碼庫解耦,讓使用者無需修改主引擎,即可在 Ascend 硬體上部署高效能 LLM。
工作原理
該專案作為一個社群維護的硬體外掛運作。它實現了一個可插拔介面(基於特定 RFC),允許 vLLM 與 Ascend 硬體進行通訊。透過使用 CANN 軟體棧和 PyTorch,這使得支援包括類 Transformer 模型、混合專家模型 (MoE)、嵌入模型 (Embedding models) 和多模態 LLM 在內的各種模型架構成為可能。
適用對象
擁有 Ascend NPU 硬體(如 Atlas 800I 或 Atlas A2/A3 系列)並希望使用 vLLM 進行高效模型推理與部署的開發人員及研究人員。
亮點
- 廣泛的模型支援:相容 Transformer、MoE、Embedding 及多模態 LLM。
- 硬體可插拔性:將硬體整合與 vLLM 核心引擎解耦,便於維護。
- 企業級硬體支援:專為 Atlas 800I 及 Atlas A2/A3 系列 NPU 進行了優化。
- 社群驅動:以外掛形式進行維護,以確保與 vLLM 的主發佈週期保持相容。