xLLM-AI/xllm

A high-performance inference engine for LLM, VLM, DiT and REC models, optimized for diverse AI accelerators. It is hosted in OpenAtom Foundation.

xLLM – 面向中國AI加速器的高性能LLM推理

是什麼 – xLLM 是一個以 C++ 建構的開源推理引擎,專為運行於多種中國原生AI晶片(Ascend NPU、Cambricon MLU、Moore Threads MUSA、Hygon DCU、MetaX MACA、Iluvatar CoreX)上的大型語言模型(LLM)所設計。它將 服務(請求排程、負載平衡)與 引擎(張量運算)分離,讓企業能以低延遲與高吞吐量大規模部署LLM服務。

核心功能

  • 硬體特定優化 – 鈴手調校的內核與記憶體管理,針對每種支援的加速器進行最佳化,並利用最新的驅動堆疊(例如 Ascend HDK 25.2)。
  • 混合KV快取管理 – 整合 Mooncake 庫,智慧地卸載與預取KV快取項目,減輕長上下文生成時的記憶體壓力。
  • 服務-引擎解耦 – 基於 Apache brpc 的輕量級 HTTP/gRPC 前端負責請求路由,而引擎則專注於純粹的運算。
  • 模型支援 – 提供即開即用的部署腳本,支援日益增長的中國導向模型清單,例如 GLM-5.3-Flash、MiniMax-M3、DeepSeek-V4-Flash 與 GLM-4.x 系列。
  • 企業級可靠性 – 該框架已在 JD.com 的零售後端經過實戰驗證,具備監控、滾動升級與多節點擴展的工具支援。

支援的硬體

芯片系列 縮寫 例子 說明
Ascend NPU NPU A2, A3 需要 HDK 驅動 ≥ 25.2
Cambricon MLU MLU MLU
Moore Threads GPU MUSA S5000
Hygon DCU DCU BW1000
MetaX MACA MACA MXC500
Iluvatar CoreX GPU ILU BI150

快速入門

  • 快速入門指南 – 分步教程,涵蓋拉取 Docker 鏡像、啟動服務與執行測試請求: https://docs.xllm-ai.com/en/getting_started/quick_start/
  • 啟動腳本 – 在單一節點或叢集上啟動服務層與引擎的詳細指令。
  • 離線推理 – 無需服務前端的批次處理說明。
  • 支援模型清單 – 包含預設部署腳本的模型目錄(例如 run_glm_53_flash.sh)。

社群與支援

  • 官方文件網站: https://docs.xllm-ai.com/
  • Quay 上託管的 Docker 鏡像: quay.io/repository/jd_xllm/xllm-ai
  • arXiv 技術報告(arXiv:2510.14686)詳細解釋架構與效能結果。
  • 中文 WeChat 群組(倉儲中的 QR 碼)用於使用者提問與公告。
  • 該專案目前已捐贈給 OpenAtom Foundation,標誌著向更廣泛的開源治理邁進。

許可證 – Apache License 2.0(以倉儲標頭為準)。

引用

@article{liu2025xllm,
  title={xLLM Technical Report},
  author={xLLM team},
  journal={arXiv preprint arXiv:2510.14686},
  year={2025}
}

以上所有資訊均直接取自倉儲的 README;未推斷任何額外功能。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案