jd-opensource/xllm
A high-performance inference engine for LLM, VLM, DiT and REC models, optimized for diverse AI accelerators. It is hosted in OpenAtom Foundation.
What it solves
xLLM 解決了在中國 AI 加速器上部署大型語言模型 (LLM) 的挑戰,提供了一個高效、企業級的推論框架,在保持高性能的同時降低了營運成本。
How it works
該框架採用服務與引擎解耦的架構,其中專用的服務層負責管理調度與可用性,而引擎層則處理實際的計算。它結合了混合 KV cache 管理(基於 Mooncake)進行智能卸載與預取,以優化記憶體與吞吐量。
Who it’s for
它專為需要將 LLM 部署在特定硬體加速器上的企業與開發者設計,例如 Ascend NPU、Cambricon MLU、Moore Threads GPU、Hygon DCU、MetaX MACA 以及 Iluvatar CoreX GPU。
Highlights
- Hardware Optimization: 針對廣泛的中國 AI 加速器進行了深度優化。
- Decoupled Architecture: 將服務管理與計算引擎分離,以獲得更好的擴展性。
- High Performance: 專為高吞吐量與低延遲而設計。
- Battle-tested: 已在 JD.com 的核心零售業務營運中通過大規模實踐驗證。