vllm-project/aibrix

Cost-efficient and pluggable Infrastructure components for GenAI inference

解決する課題

AIBrixは、スケーラブルなエンタープライズグレードのGenAI推論インフラストラクチャを構築するための構成要素を提供します。クラウドネイティブ環境における大規模言語モデル(LLM)推論のデプロイ、管理、スケーリングの課題、特にコスト効率とリソースの最適化に焦点を当てて解決します。

仕組み

AIBrixは、LLM推論(vLLMなど)のためのKubernetesネイティブなコントロールプレーンとして機能します。クラウドネイティブなアーキテクチャを利用して、モデルとそのレプリカのライフサイクルを管理します。主なコンポーネントには、インテリジェントなルーティングを行うためのLLM Gateway、動的なリソース調整を行うためのアプリ特化型オートスケーラー、およびメトリクスの標準化とモデル管理のための統合AIランタイムサイドカーが含まれます。

対象ユーザー

サービスレベル目標(SLO)を維持しながら、複数のノードや異種GPUハードウェアにわたって大規模なLLM推論ワークロードをデプロイする必要がある企業やシステム研究者向けに設計されています。

ハイライト

  • LLM認識ルーティング: 専用のゲートウェイを介して、複数のモデルとレプリカにトラフィックを効率的に転送します。
  • コスト効率の高い異種サービング: 混合GPU推論をサポートし、運用コストを削減します。
  • 高密度LoRA管理: モデルの軽量な低ランク適応(LoRA)を合理的にサポートします。
  • 分散KVキャッシュ: 異なる推論エンジン間で高容量のKV再利用を可能にします。
  • リソース管理: アプリ特化型のオートスケーラーと、プロアクティブなGPUハードウェア障害検知が含まれます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト