jd-opensource/xllm

A high-performance inference engine for LLM, VLM, DiT and REC models, optimized for diverse AI accelerators. It is hosted in OpenAtom Foundation.

What it solves

xLLMは、中国のAIアクセラレータ上で大言語モデル (LLM) をデプロイする際の課題を解決します。高性能を維持しながら、運用コストを削減できる効率的なエンタープライズグレードの推論フレームワークを提供します。

How it works

本フレームワークは、サービス層とエンジン層を分離したデカップリングアーキテクチャを採用しています。専用のサービス層がスケジューリングと可用性を管理し、エンジン層が実際の計算処理を行います。また、Mooncakeに基づくハイブリッドKV cache管理を組み込んでおり、インテリジェントなオフロードとプリフェッチにより、メモリとスループットを最適化します。

Who it’s for

Ascend NPU、Cambricon MLU、Moore Threads GPU、Hygon DCU、MetaX MACA、および Iluvatar CoreX GPUなどの特定のハードウェアアクセラレータにLLMをデプロイする必要がある企業や開発者向けに設計されています。

Highlights

  • Hardware Optimization: 幅広い中国のAIアクセラレータに対して深く最適化されています。
  • Decoupled Architecture: サービス管理と計算エンジンを分離することで、より高いスケーラビリティを実現します。
  • High Performance: 高スループットと低レイテンシを実現するために設計されています。
  • Battle-tested: JD.comのコアなリテール事業運営において、大規模な環境で実証済みです。