vllm-project/production-stack

vLLM’s reference system for K8S-native cluster-wide deployment with community-driven performance optimization

何を解決するか

このプロジェクトは、vLLMを本番環境にデプロイするための参考実装を提供します。アプリケーションコードの変更なしに単一インスタンスから分散型デプロイにスケーリングする課題を解決し、組み込みのモニタリングとパフォーマンス最適化(リクエストルーティングやKVキャッシュのオフロードなど)を提供します。

動作方法

このスタックはKubernetes上でHelm経由でデプロイされ、主に3つのコンポーネントで構成されています:

  • サービングエンジン:複数のvLLMエンジンがLLMを実行します。
  • リクエストルーター:ルーティングキーまたはセッションIDに基づいて、最も適切なバックエンドにトラフィックを転送し、KVキャッシュの再利用を最大化します。
  • オブザーバビリティスタック:PrometheusとGrafanaを使用したモニタリングシステムで、遅延、Time-to-First-Token(TTFT)、GPU KVキャッシュ使用率などのメトリクスを追跡します。

対象ユーザー

AWS、GCP、Azure、Lambda Labsなどのさまざまなクラウドプラットフォーム上で、単一ノード構成からスケーラブルで本番対応のKubernetesクラスタにvLLMベースのLLMサービングを移行したい開発者およびMLエンジニア。

主な特徴

  • シームレスなスケーリング:アプリケーションコードを変更せずにvLLMインスタンスをスケーリング可能。
  • インテリジェントなルーティング:ラウンドロビンおよびセッションIDベースのルーティングをサポートし、効率を向上。
  • OpenAI API互換性:vLLMと同一のインターフェースを維持し、簡単に統合可能。
  • 包括的なモニタリング:リクエスト遅延、保留中のリクエスト、KVキャッシュヒット率を追跡する詳細なGrafanaダッシュボード。
  • KVキャッシュオフロード:LMCacheとの統合によりパフォーマンスを最適化。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト