xLLM-AI/xllm
A high-performance inference engine for LLM, VLM, DiT and REC models, optimized for diverse AI accelerators. It is hosted in OpenAtom Foundation.
xLLM – 面向中国AI加速器的高性能LLM推理
是什么 – xLLM 是一个用 C++ 构建的开源推理引擎,专为运行在多种中国原生AI芯片(Ascend NPU、Cambricon MLU、Moore Threads MUSA、Hygon DCU、MetaX MACA、Iluvatar CoreX)上的大语言模型(LLM)设计。它将 服务(请求调度、负载均衡)与 引擎(张量计算)分离,使企业能够以低延迟和高吞吐量大规模部署LLM服务。
核心功能
- 硬件特定优化 – 针对每种支持的加速器进行手工调优的内核和内存管理,利用最新的驱动栈(例如 Ascend HDK 25.2)。
- 混合KV缓存管理 – 集成 Mooncake 库,智能地卸载和预取KV缓存条目,减轻长上下文生成时的内存压力。
- 服务-引擎解耦 – 基于 Apache brpc 的轻量级 HTTP/gRPC 前端负责请求路由,而引擎则专注于纯粹的计算。
- 模型支持 – 提供针对日益增长的中国聚焦模型列表的即开即用部署脚本,例如 GLM-5.3-Flash、MiniMax-M3、DeepSeek-V4-Flash 和 GLM-4.x 系列。
- 企业级可靠性 – 该框架已在 JD.com 的零售后端经过实战检验,具备监控、滚动升级和多节点扩展的工具支持。
支持的硬件
| 芯片系列 | 缩写 | 示例 | 说明 |
|---|---|---|---|
| Ascend NPU | NPU | A2, A3 | 需要 HDK 驱动 ≥ 25.2 |
| Cambricon MLU | MLU | MLU | |
| Moore Threads GPU | MUSA | S5000 | |
| Hygon DCU | DCU | BW1000 | |
| MetaX MACA | MACA | MXC500 | |
| Iluvatar CoreX GPU | ILU | BI150 |
快速入门
- 快速入门指南 – 逐步教程,涵盖拉取Docker镜像、启动服务和运行测试请求: https://docs.xllm-ai.com/en/getting_started/quick_start/
- 启动脚本 – 在单节点或集群上启动服务层和引擎的详细命令。
- 离线推理 – 无需服务前端的批量处理说明。
- 支持模型列表 – 包含预置部署脚本的模型目录(例如
run_glm_53_flash.sh)。
社区与支持
- 官方文档网站: https://docs.xllm-ai.com/
- Quay 上托管的 Docker 镜像:
quay.io/repository/jd_xllm/xllm-ai - arXiv 技术报告(arXiv:2510.14686)详细解释了架构和性能结果。
- 中国语言 WeChat 群组(仓库中的二维码)用于用户提问和公告。
- 该项目现已捐赠给 OpenAtom Foundation,标志着向更广泛的开源治理迈进。
许可证 – Apache License 2.0(以仓库头部为准)。
引用
@article{liu2025xllm,
title={xLLM Technical Report},
author={xLLM team},
journal={arXiv preprint arXiv:2510.14686},
year={2025}
}
以上所有信息均直接取自仓库的 README;未推断任何额外功能。
相关
- 项目
- 项目
- 项目
- 项目
- 项目