xLLM-AI/xllm
A high-performance inference engine for LLM, VLM, DiT and REC models, optimized for diverse AI accelerators. It is hosted in OpenAtom Foundation.
解决的问题
在标准硬件上部署大语言模型可能会成本高昂且效率低下。xLLM 提供企业级解决方案,专门针对中国 AI 加速器优化,实现高吞吐量、低延迟的推理,降低大规模应用的部署成本。
工作原理
它采用解耦架构,其中服务层负责管理调度和可用性,而引擎层负责实际计算。该框架包含高级功能,例如具有智能卸载和预取功能的混合 KV 缓存管理,以实现效率最大化。
适用对象
专为需要在 Ascend NPU、Cambricon MLU、Moore Threads GPU 以及其他区域 AI 加速器等中国专用硬件上部署大语言模型的企业和开发人员设计。
亮点
- 高性能:提供顶级的吞吐量和低延迟。
- 专用硬件支持:针对包括 Ascend、Cambricon、Moore Threads、Hygon、MetaX 和 Iluvatar 在内的广泛中国 AI 加速器进行了深度优化。
- 解耦架构:将服务管理与计算执行分离。
- 经过实战检验:已在京东 (JD.com) 的核心零售业务运营中得到大规模验证。