vllm-project/production-stack
vLLM’s reference system for K8S-native cluster-wide deployment with community-driven performance optimization
何を解決するか
このプロジェクトは、vLLMを本番環境にデプロイするための参考実装を提供します。アプリケーションコードの変更なしに単一インスタンスから分散型デプロイにスケーリングする課題を解決し、組み込みのモニタリングとパフォーマンス最適化(リクエストルーティングやKVキャッシュのオフロードなど)を提供します。
動作方法
このスタックはKubernetes上でHelm経由でデプロイされ、主に3つのコンポーネントで構成されています:
- サービングエンジン:複数のvLLMエンジンがLLMを実行します。
- リクエストルーター:ルーティングキーまたはセッションIDに基づいて、最も適切なバックエンドにトラフィックを転送し、KVキャッシュの再利用を最大化します。
- オブザーバビリティスタック:PrometheusとGrafanaを使用したモニタリングシステムで、遅延、Time-to-First-Token(TTFT)、GPU KVキャッシュ使用率などのメトリクスを追跡します。
対象ユーザー
AWS、GCP、Azure、Lambda Labsなどのさまざまなクラウドプラットフォーム上で、単一ノード構成からスケーラブルで本番対応のKubernetesクラスタにvLLMベースのLLMサービングを移行したい開発者およびMLエンジニア。
主な特徴
- シームレスなスケーリング:アプリケーションコードを変更せずにvLLMインスタンスをスケーリング可能。
- インテリジェントなルーティング:ラウンドロビンおよびセッションIDベースのルーティングをサポートし、効率を向上。
- OpenAI API互換性:vLLMと同一のインターフェースを維持し、簡単に統合可能。
- 包括的なモニタリング:リクエスト遅延、保留中のリクエスト、KVキャッシュヒット率を追跡する詳細なGrafanaダッシュボード。
- KVキャッシュオフロード:LMCacheとの統合によりパフォーマンスを最適化。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト