xLLM-AI/xllm
A high-performance inference engine for LLM, VLM, DiT and REC models, optimized for diverse AI accelerators. It is hosted in OpenAtom Foundation.
xLLM – 面向中國AI加速器的高性能LLM推理
是什麼 – xLLM 是一個以 C++ 建構的開源推理引擎,專為運行於多種中國原生AI晶片(Ascend NPU、Cambricon MLU、Moore Threads MUSA、Hygon DCU、MetaX MACA、Iluvatar CoreX)上的大型語言模型(LLM)所設計。它將 服務(請求排程、負載平衡)與 引擎(張量運算)分離,讓企業能以低延遲與高吞吐量大規模部署LLM服務。
核心功能
- 硬體特定優化 – 鈴手調校的內核與記憶體管理,針對每種支援的加速器進行最佳化,並利用最新的驅動堆疊(例如 Ascend HDK 25.2)。
- 混合KV快取管理 – 整合 Mooncake 庫,智慧地卸載與預取KV快取項目,減輕長上下文生成時的記憶體壓力。
- 服務-引擎解耦 – 基於 Apache brpc 的輕量級 HTTP/gRPC 前端負責請求路由,而引擎則專注於純粹的運算。
- 模型支援 – 提供即開即用的部署腳本,支援日益增長的中國導向模型清單,例如 GLM-5.3-Flash、MiniMax-M3、DeepSeek-V4-Flash 與 GLM-4.x 系列。
- 企業級可靠性 – 該框架已在 JD.com 的零售後端經過實戰驗證,具備監控、滾動升級與多節點擴展的工具支援。
支援的硬體
| 芯片系列 | 縮寫 | 例子 | 說明 |
|---|---|---|---|
| Ascend NPU | NPU | A2, A3 | 需要 HDK 驅動 ≥ 25.2 |
| Cambricon MLU | MLU | MLU | |
| Moore Threads GPU | MUSA | S5000 | |
| Hygon DCU | DCU | BW1000 | |
| MetaX MACA | MACA | MXC500 | |
| Iluvatar CoreX GPU | ILU | BI150 |
快速入門
- 快速入門指南 – 分步教程,涵蓋拉取 Docker 鏡像、啟動服務與執行測試請求: https://docs.xllm-ai.com/en/getting_started/quick_start/
- 啟動腳本 – 在單一節點或叢集上啟動服務層與引擎的詳細指令。
- 離線推理 – 無需服務前端的批次處理說明。
- 支援模型清單 – 包含預設部署腳本的模型目錄(例如
run_glm_53_flash.sh)。
社群與支援
- 官方文件網站: https://docs.xllm-ai.com/
- Quay 上託管的 Docker 鏡像:
quay.io/repository/jd_xllm/xllm-ai - arXiv 技術報告(arXiv:2510.14686)詳細解釋架構與效能結果。
- 中文 WeChat 群組(倉儲中的 QR 碼)用於使用者提問與公告。
- 該專案目前已捐贈給 OpenAtom Foundation,標誌著向更廣泛的開源治理邁進。
許可證 – Apache License 2.0(以倉儲標頭為準)。
引用
@article{liu2025xllm,
title={xLLM Technical Report},
author={xLLM team},
journal={arXiv preprint arXiv:2510.14686},
year={2025}
}
以上所有資訊均直接取自倉儲的 README;未推斷任何額外功能。
相關
- 專案
- 專案
- 專案
- 專案
- 專案