vllm-project/vllm-ascend

Community maintained hardware plugin for vLLM on Ascend

解決的問題

讓 vLLM 推理引擎能在華為 Ascend NPU 上順暢運行,透過可插入式介面將硬體整合與 vLLM 核心程式碼庫分離。

工作原理

作為一個硬體插件,實作特定介面(基於硬體可插入 RFC)來橋接 vLLM 的需求與 Ascend NPU 架構。這使得多種模型類型——包括基於 Transformer 的 LLM、專家混合模型(MoE)、嵌入模型以及多模態 LLM——都能在 Ascend 硬體上執行。

適用對象

使用華為 Ascend 硬體(如 Atlas 800I 或 Atlas A2/A3 系列)並希望使用 vLLM 框架部署高效率 LLM 推論的開發者與 AI 工程師。

主要特色

  • 支援廣泛的模型架構,包括 MoE 與多模態 LLM。
  • 遵循硬體可插入架構,保持主 vLLM 項目乾淨。
  • 相容 CANN 9.1.0 及特定版本的 PyTorch/TorchNPU。
  • 社群維護,提供多種 Atlas NPU 系列的專用支援。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案