xLLM-AI/xllm
A high-performance inference engine for LLM, VLM, DiT and REC models, optimized for diverse AI accelerators. It is hosted in OpenAtom Foundation.
xLLM – 中国AIアクセラレータ向け高性能LLM推論
何であるか – xLLMはC++で構築されたオープンソースの推論エンジンで、中国発のAIチップ(Ascend NPU、Cambricon MLU、Moore Threads MUSA、Hygon DCU、MetaX MACA、Iluvatar CoreX)上で動作する大規模言語モデル(LLM)を対象としています。サービス層(リクエストスケジューリング、ロードバランシング)とエンジン層(テンソル計算)を分離し、低遅延かつ高スループットでLLMサービスを大規模に展開できるように設計されています。
主な機能
- ハードウェア固有の最適化 – 各対応アクセラレータ向けに手動最適化されたカーネルとメモリ管理を実装。最新のドライバスタック(例:Ascend HDK 25.2)を活用。
- ハイブリッドKVキャッシュ管理 – Mooncakeライブラリを統合し、KVキャッシュエントリを知的にオフロードおよびプリフェッチすることで、長文生成時のメモリ圧力を軽減。
- サービス-エンジンの分離 – Apache brpcに基づく軽量なHTTP/gRPCフロントエンドがリクエストルーティングを担当し、エンジンは純粋に計算処理に集中。
- モデル対応 – GLM-5.3-Flash、MiniMax-M3、DeepSeek-V4-Flash、GLM-4.xシリーズなど、中国志向のモデルに対し、当日導入可能なデプロイスクリプトを提供。
- 企業向け信頼性 – JD.comの小売バックエンドで実戦検証済み。モニタリング、ローリングアップグレード、マルチノードスケーリングのツールを備える。
対応ハードウェア
| チップファミリー | 略称 | 例 | 備考 |
|---|---|---|---|
| Ascend NPU | NPU | A2, A3 | HDKドライバ ≥ 25.2 必須 |
| Cambricon MLU | MLU | MLU | |
| Moore Threads GPU | MUSA | S5000 | |
| Hygon DCU | DCU | BW1000 | |
| MetaX MACA | MACA | MXC500 | |
| Iluvatar CoreX GPU | ILU | BI150 |
導入方法
- クイックスタートガイド – Dockerイメージの取得、サービス起動、テストリクエストの実行までステップバイステップのチュートリアル: https://docs.xllm-ai.com/en/getting_started/quick_start/
- 起動スクリプト – 単一ノードまたはクラスタ上でサービス層とエンジンを起動する詳細なコマンド。
- オフライン推論 – サービスフロントエンドなしでバッチ処理を行う手順。
- 対応モデル一覧 – 事前作成されたデプロイスクリプト付きのモデルカタログ(例:
run_glm_53_flash.sh)。
コミュニティとサポート
- 公式ドキュメントサイト: https://docs.xllm-ai.com/
- Quay上にホストされたDockerイメージ:
quay.io/repository/jd_xllm/xllm-ai - arXiv(arXiv:2510.14686)に掲載された技術レポートでアーキテクチャとパフォーマンス結果を説明。
- ユーザーの質問やお知らせ用の中国語WeChatグループ(リポジトリ内のQRコード参照)。
- プロジェクトは現在、OpenAtom Foundationへの寄付として移行され、より広範なオープンソースガバナンスへの移行を示している。
ライセンス – Apache License 2.0(リポジトリのヘッダーに準拠)。
引用
@article{liu2025xllm,
title={xLLM Technical Report},
author={xLLM team},
journal={arXiv preprint arXiv:2510.14686},
year={2025}
}
上記のすべての情報はリポジトリのREADMEから直接取得;追加の機能は推測されていません。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト