xLLM-AI/xllm

A high-performance inference engine for LLM, VLM, DiT and REC models, optimized for diverse AI accelerators. It is hosted in OpenAtom Foundation.

xLLM – 中国AIアクセラレータ向け高性能LLM推論

何であるか – xLLMはC++で構築されたオープンソースの推論エンジンで、中国発のAIチップ(Ascend NPU、Cambricon MLU、Moore Threads MUSA、Hygon DCU、MetaX MACA、Iluvatar CoreX)上で動作する大規模言語モデル(LLM)を対象としています。サービス層(リクエストスケジューリング、ロードバランシング)とエンジン層(テンソル計算)を分離し、低遅延かつ高スループットでLLMサービスを大規模に展開できるように設計されています。

主な機能

  • ハードウェア固有の最適化 – 各対応アクセラレータ向けに手動最適化されたカーネルとメモリ管理を実装。最新のドライバスタック(例:Ascend HDK 25.2)を活用。
  • ハイブリッドKVキャッシュ管理 – Mooncakeライブラリを統合し、KVキャッシュエントリを知的にオフロードおよびプリフェッチすることで、長文生成時のメモリ圧力を軽減。
  • サービス-エンジンの分離 – Apache brpcに基づく軽量なHTTP/gRPCフロントエンドがリクエストルーティングを担当し、エンジンは純粋に計算処理に集中。
  • モデル対応 – GLM-5.3-Flash、MiniMax-M3、DeepSeek-V4-Flash、GLM-4.xシリーズなど、中国志向のモデルに対し、当日導入可能なデプロイスクリプトを提供。
  • 企業向け信頼性 – JD.comの小売バックエンドで実戦検証済み。モニタリング、ローリングアップグレード、マルチノードスケーリングのツールを備える。

対応ハードウェア

チップファミリー 略称 備考
Ascend NPU NPU A2, A3 HDKドライバ ≥ 25.2 必須
Cambricon MLU MLU MLU
Moore Threads GPU MUSA S5000
Hygon DCU DCU BW1000
MetaX MACA MACA MXC500
Iluvatar CoreX GPU ILU BI150

導入方法

  • クイックスタートガイド – Dockerイメージの取得、サービス起動、テストリクエストの実行までステップバイステップのチュートリアル: https://docs.xllm-ai.com/en/getting_started/quick_start/
  • 起動スクリプト – 単一ノードまたはクラスタ上でサービス層とエンジンを起動する詳細なコマンド。
  • オフライン推論 – サービスフロントエンドなしでバッチ処理を行う手順。
  • 対応モデル一覧 – 事前作成されたデプロイスクリプト付きのモデルカタログ(例:run_glm_53_flash.sh)。

コミュニティとサポート

  • 公式ドキュメントサイト: https://docs.xllm-ai.com/
  • Quay上にホストされたDockerイメージ: quay.io/repository/jd_xllm/xllm-ai
  • arXiv(arXiv:2510.14686)に掲載された技術レポートでアーキテクチャとパフォーマンス結果を説明。
  • ユーザーの質問やお知らせ用の中国語WeChatグループ(リポジトリ内のQRコード参照)。
  • プロジェクトは現在、OpenAtom Foundationへの寄付として移行され、より広範なオープンソースガバナンスへの移行を示している。

ライセンス – Apache License 2.0(リポジトリのヘッダーに準拠)。

引用

@article{liu2025xllm,
  title={xLLM Technical Report},
  author={xLLM team},
  journal={arXiv preprint arXiv:2510.14686},
  year={2025}
}

上記のすべての情報はリポジトリのREADMEから直接取得;追加の機能は推測されていません。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト