xLLM-AI/xllm

A high-performance inference engine for LLM, VLM, DiT and REC models, optimized for diverse AI accelerators. It is hosted in OpenAtom Foundation.

解決的問題

在標準硬體上部署大語言模型可能會成本高昂且效率低下。xLLM 提供企業級解決方案,專門針對中國 AI 加速器優化,實現高吞吐量、低延遲的推理,降低大規模應用的部署成本。

工作原理

它採用解耦架構,其中服務層負責管理調度與可用性,而引擎層負責實際計算。該框架包含進階功能,例如具有智慧卸載與預取功能的混合 KV 快取管理,以實現效率最大化。

適用對象

專為需要在 Ascend NPU、Cambricon MLU、Moore Threads GPU 以及其他區域 AI 加速器等中國專用硬體上部署大語言模型的企業與開發人員設計。

亮點

  • 高性能:提供頂級的吞吐量與低延遲。
  • 專用硬體支援:針對包括 Ascend、Cambricon、Moore Threads、Hygon、MetaX 與 Iluvatar 在內的廣泛中國 AI 加速器進行了深度優化。
  • 解耦架構:將服務管理與計算執行分離。
  • 經過實戰驗證:已在京東 (JD.com) 的核心零售業務營運中得到大規模驗證。