xLLM-AI/xllm

A high-performance inference engine for LLM, VLM, DiT and REC models, optimized for diverse AI accelerators. It is hosted in OpenAtom Foundation.

xLLM – 面向中国AI加速器的高性能LLM推理

是什么 – xLLM 是一个用 C++ 构建的开源推理引擎,专为运行在多种中国原生AI芯片(Ascend NPU、Cambricon MLU、Moore Threads MUSA、Hygon DCU、MetaX MACA、Iluvatar CoreX)上的大语言模型(LLM)设计。它将 服务(请求调度、负载均衡)与 引擎(张量计算)分离,使企业能够以低延迟和高吞吐量大规模部署LLM服务。

核心功能

  • 硬件特定优化 – 针对每种支持的加速器进行手工调优的内核和内存管理,利用最新的驱动栈(例如 Ascend HDK 25.2)。
  • 混合KV缓存管理 – 集成 Mooncake 库,智能地卸载和预取KV缓存条目,减轻长上下文生成时的内存压力。
  • 服务-引擎解耦 – 基于 Apache brpc 的轻量级 HTTP/gRPC 前端负责请求路由,而引擎则专注于纯粹的计算。
  • 模型支持 – 提供针对日益增长的中国聚焦模型列表的即开即用部署脚本,例如 GLM-5.3-Flash、MiniMax-M3、DeepSeek-V4-Flash 和 GLM-4.x 系列。
  • 企业级可靠性 – 该框架已在 JD.com 的零售后端经过实战检验,具备监控、滚动升级和多节点扩展的工具支持。

支持的硬件

芯片系列 缩写 示例 说明
Ascend NPU NPU A2, A3 需要 HDK 驱动 ≥ 25.2
Cambricon MLU MLU MLU
Moore Threads GPU MUSA S5000
Hygon DCU DCU BW1000
MetaX MACA MACA MXC500
Iluvatar CoreX GPU ILU BI150

快速入门

  • 快速入门指南 – 逐步教程,涵盖拉取Docker镜像、启动服务和运行测试请求: https://docs.xllm-ai.com/en/getting_started/quick_start/
  • 启动脚本 – 在单节点或集群上启动服务层和引擎的详细命令。
  • 离线推理 – 无需服务前端的批量处理说明。
  • 支持模型列表 – 包含预置部署脚本的模型目录(例如 run_glm_53_flash.sh)。

社区与支持

  • 官方文档网站: https://docs.xllm-ai.com/
  • Quay 上托管的 Docker 镜像: quay.io/repository/jd_xllm/xllm-ai
  • arXiv 技术报告(arXiv:2510.14686)详细解释了架构和性能结果。
  • 中国语言 WeChat 群组(仓库中的二维码)用于用户提问和公告。
  • 该项目现已捐赠给 OpenAtom Foundation,标志着向更广泛的开源治理迈进。

许可证 – Apache License 2.0(以仓库头部为准)。

引用

@article{liu2025xllm,
  title={xLLM Technical Report},
  author={xLLM team},
  journal={arXiv preprint arXiv:2510.14686},
  year={2025}
}

以上所有信息均直接取自仓库的 README;未推断任何额外功能。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目