jd-opensource/xllm

A high-performance inference engine for LLM, VLM, DiT and REC models, optimized for diverse AI accelerators. It is hosted in OpenAtom Foundation.

What it solves

xLLM은 중국 AI 가속기에서 대규모 언어 모델(LLM)을 배포하는 문제를 해결합니다. 높은 성능을 유지하면서 운영 비용을 절감할 수 있는 효율적인 엔터프라이즈급 추론 프레임워크를 제공합니다.

How it works

xLLM 프레임워크는 서비스-엔진 분리형(decoupled) 아키텍처를 사용하여, 전용 서비스 레이어가 스케줄링과 가용성을 관리하고 엔진 레이어가 실제 계산을 처리합니다. 또한 Mooncake를 기반으로 한 하이브리드 KV cache 관리를 통합하여 지능적인 오프로딩과 프리페칭을 통해 메모리와 처리량을 최적화합니다.

Who it’s for

Ascend NPU, Cambricon MLU, Moore Threads GPU, Hygon DCU, MetaX MACA, 및 Iluvatar CoreX GPU와 같은 특정 하드웨어 가속기에 LLM을 배포해야 하는 기업과 개발자를 위해 설계되었습니다.

Highlights

  • Hardware Optimization: 다양한 중국 AI 가속기에 대해 깊이 최적화되었습니다.
  • Decoupled Architecture: 서비스 관리와 계산 엔진을 분리하여 더 나은 확장성을 제공합니다.
  • High Performance: 고처리량과 저지연을 실현하기 위해 설계되었습니다.
  • Battle-tested: JD.com의 핵심 리테일 비즈니스 운영 내에서 대규모로 검증되었습니다.