xLLM-AI/xllm

A high-performance inference engine for LLM, VLM, DiT and REC models, optimized for diverse AI accelerators. It is hosted in OpenAtom Foundation.

해결하는 문제

표준 하드웨어에서 대규모 언어 모델을 배포하는 것은 비용이 많이 들고 비효율적일 수 있습니다. xLLM은 중국 AI 가속기에 특별히 최적화된 고처리량, 저지연 추론을 가능하게 하는 엔터프라이즈급 솔루션을 제공하여 대규모 애플리케이션의 배포 비용을 절감합니다.

작동 방식

서비스 계층이 스케줄링과 가용성을 관리하고 엔진 계층이 실제 계산을 처리하는 분리된 아키텍처를 활용합니다. 이 프레임워크에는 효율성을 극대화하기 위한 지능형 오프로딩 및 프리페칭을 포함한 하이브리드 KV 캐시 관리와 같은 고급 기능이 포함되어 있습니다.

대상 사용자

Ascend NPUs, Cambricon MLUs, Moore Threads GPUs 및 기타 지역 AI 가속기와 같은 중국 전용 하드웨어에 대규모 언어 모델을 배포해야 하는 기업 및 개발자를 위해 설계되었습니다.

주요 특징

  • 고성능: 최고 수준의 처리량과 낮은 지연 시간을 제공합니다.
  • 전용 하드웨어 지원: Ascend, Cambricon, Moore Threads, Hygon, MetaX, Iluvatar를 포함한 광범위한 중국 AI 가속기에 대해 깊이 최적화되었습니다.
  • 분리된 아키텍처: 서비스 관리와 계산 실행을 분리합니다.
  • 검증된 성능: JD.com의 핵심 소매 비즈니스 운영 내 대규모 환경에서 검증되었습니다.