xLLM-AI/xllm
A high-performance inference engine for LLM, VLM, DiT and REC models, optimized for diverse AI accelerators. It is hosted in OpenAtom Foundation.
xLLM – 중국 AI 가속기용 고성능 LLM 추론
무엇인가요 – xLLM은 C++로 구현된 오픈소스 추론 엔진으로, 중국산 AI 칩(Ascend NPU, Cambricon MLU, Moore Threads MUSA, Hygon DCU, MetaX MACA, Iluvatar CoreX)에서 작동하는 대규모 언어 모델(LLM)을 대상으로 합니다. 서비스(요청 스케줄링, 로드 밸런싱)와 엔진(텐서 계산)을 분리하여 기업이 저지연, 고처리량으로 LLM 서비스를 대규모로 배포할 수 있도록 설계되었습니다.
주요 기능
- 하드웨어별 최적화 – 각 지원 가속기용 수동 최적화된 커널과 메모리 관리, 최신 드라이버 스택(예: Ascend HDK 25.2) 활용.
- 하이브리드 KV 캐시 관리 – Mooncake 라이브러리를 통합하여 KV 캐시 항목을 지능적으로 오프로드 및 프리페치함으로써 긴 컨텍스트 생성 시 메모리 부담을 줄임.
- 서비스-엔진 분리 – Apache brpc 기반의 가벼운 HTTP/gRPC 프론트엔드가 요청 라우팅을 담당하고, 엔진은 순수하게 계산에 집중.
- 모델 지원 – GLM-5.3-Flash, MiniMax-M3, DeepSeek-V4-Flash, GLM-4.x 시리즈 등 중국 중심 모델에 대해 당일 배포 스크립트 제공.
- 기업급 신뢰성 – JD.com의 소매 백엔드에서 실전 검증 완료. 모니터링, 롤링 업그레이드, 멀티노드 스케일링 도구 포함.
지원하는 하드웨어
| 칩 패밀리 | 약어 | 예시 | 비고 |
|---|---|---|---|
| Ascend NPU | NPU | A2, A3 | HDK 드라이버 ≥ 25.2 필요 |
| Cambricon MLU | MLU | MLU | |
| Moore Threads GPU | MUSA | S5000 | |
| Hygon DCU | DCU | BW1000 | |
| MetaX MACA | MACA | MXC500 | |
| Iluvatar CoreX GPU | ILU | BI150 |
시작하기
- 빠른 시작 가이드 – Docker 이미지 다운로드, 서비스 실행, 테스트 요청 수행까지 단계별 튜토리얼: https://docs.xllm-ai.com/en/getting_started/quick_start/
- 시작 스크립트 – 단일 노드 또는 클러스터에서 서비스 계층과 엔진을 시작하는 상세 명령어.
- 오프라인 추론 – 서비스 프론트엔드 없이 배치 처리를 수행하는 방법.
- 지원 모델 목록 – 사전 제작된 배포 스크립트가 있는 모델 카탈로그 (예:
run_glm_53_flash.sh).
커뮤니티 및 지원
- 공식 문서 사이트: https://docs.xllm-ai.com/
- Quay에 호스팅된 Docker 이미지:
quay.io/repository/jd_xllm/xllm-ai - arXiv (arXiv:2510.14686)에 게재된 기술 보고서에서 아키텍처와 성능 결과 설명.
- 사용자 질문 및 공지용 중국어 WeChat 그룹 (리포지토리 내 QR 코드 참조).
- 프로젝트는 현재 OpenAtom Foundation에 기부되어, 더 넓은 오픈소스 거버넌스로의 전환을 의미.
라이선스 – Apache License 2.0 (리포지토리 헤더 기준).
인용
@article{liu2025xllm,
title={xLLM Technical Report},
author={xLLM team},
journal={arXiv preprint arXiv:2510.14686},
year={2025}
}
위 정보는 리포지토리의 README에서 직접 인용되었으며, 추가 기능은 추정되지 않았습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트