xLLM-AI/xllm
A high-performance inference engine for LLM, VLM, DiT and REC models, optimized for diverse AI accelerators. It is hosted in OpenAtom Foundation.
解決する課題
標準的なハードウェアでの大規模言語モデル(LLM)のデプロイは、コストがかかり非効率になる可能性があります。xLLMは、中国のAIアクセラレータに特化して最適化された、高スループット・低レイテンシの推論を可能にするエンタープライズグレードのソリューションを提供し、大規模アプリケーションのデプロイコストを削減します。
仕組み
サービス層がスケジューリングと可用性を管理し、エンジン層が実際の計算を処理する、デカップル(分離)されたアーキテクチャを利用しています。このフレームワークには、効率を最大化するためのインテリジェントなオフローディングとプリフェッチを備えたハイブリッドKVキャッシュ管理などの高度な機能が含まれています。
対象ユーザー
Ascend NPU、Cambricon MLU、Moore Threads GPU、およびその他の地域のAIアクセラレータなどの、中国の専用ハードウェア上に大規模言語モデルをデプロイする必要がある企業や開発者向けに設計されています。
ハイライト
- 高いパフォーマンス: トップクラスのスループットと低レイテンシを実現。
- 専用ハードウェアのサポート: Ascend、Cambricon、Moore Threads、Hygon、MetaX、Iluvatarを含む幅広い中国のAIアクセラレータ向けに深く最適化されています。
- デカップルされたアーキテクチャ: サービス管理と計算実行を分離。
- 実証済み: JD.comのコア小売事業における大規模な運用で実証されています。