xLLM-AI/xllm
A high-performance inference engine for LLM, VLM, DiT and REC models, optimized for diverse AI accelerators. It is hosted in OpenAtom Foundation.
解決的問題
在標準硬體上部署大語言模型可能會成本高昂且效率低下。xLLM 提供企業級解決方案,專門針對中國 AI 加速器優化,實現高吞吐量、低延遲的推理,降低大規模應用的部署成本。
工作原理
它採用解耦架構,其中服務層負責管理調度與可用性,而引擎層負責實際計算。該框架包含進階功能,例如具有智慧卸載與預取功能的混合 KV 快取管理,以實現效率最大化。
適用對象
專為需要在 Ascend NPU、Cambricon MLU、Moore Threads GPU 以及其他區域 AI 加速器等中國專用硬體上部署大語言模型的企業與開發人員設計。
亮點
- 高性能:提供頂級的吞吐量與低延遲。
- 專用硬體支援:針對包括 Ascend、Cambricon、Moore Threads、Hygon、MetaX 與 Iluvatar 在內的廣泛中國 AI 加速器進行了深度優化。
- 解耦架構:將服務管理與計算執行分離。
- 經過實戰驗證:已在京東 (JD.com) 的核心零售業務營運中得到大規模驗證。