xLLM-AI/xllm

A high-performance inference engine for LLM, VLM, DiT and REC models, optimized for diverse AI accelerators. It is hosted in OpenAtom Foundation.

解决的问题

在标准硬件上部署大语言模型可能会成本高昂且效率低下。xLLM 提供企业级解决方案,专门针对中国 AI 加速器优化,实现高吞吐量、低延迟的推理,降低大规模应用的部署成本。

工作原理

它采用解耦架构,其中服务层负责管理调度和可用性,而引擎层负责实际计算。该框架包含高级功能,例如具有智能卸载和预取功能的混合 KV 缓存管理,以实现效率最大化。

适用对象

专为需要在 Ascend NPU、Cambricon MLU、Moore Threads GPU 以及其他区域 AI 加速器等中国专用硬件上部署大语言模型的企业和开发人员设计。

亮点

  • 高性能:提供顶级的吞吐量和低延迟。
  • 专用硬件支持:针对包括 Ascend、Cambricon、Moore Threads、Hygon、MetaX 和 Iluvatar 在内的广泛中国 AI 加速器进行了深度优化。
  • 解耦架构:将服务管理与计算执行分离。
  • 经过实战检验:已在京东 (JD.com) 的核心零售业务运营中得到大规模验证。