vllm-project/semantic-router
A programmable Mixture-of-Models router for heterogeneous LLM inference
何を解決するか
vLLM Semantic Router は、分散した LLM インフラの問題を解決するように設計されています。アプリケーションにルーティングロジックをハードコードするのではなく、開発者が「モデルの混合(Mixture-of-Models)」システムを管理できるプログラマブルなレイヤーを提供します。これにより、特定のシグナルやポリシーに基づいて各リクエストに適したモデルパスを選択することで、品質、コスト、レイテンシ、プライバシーを最適化できます。
動作方法
このシステムは、リクエストのシグナル、ユーザーの好み、アプリケーションポリシーを評価してモデルパスを選択または構成するルーティングレイヤーとして機能します。GPU、アクセラレータ、エッジデバイス、クラウドインフラなど、異種のコンピューティング環境間でリクエストをルーティング可能であり、プライバシーを保つためにデータ境界を維持します。
対象ユーザー
複数のモデルを異なるハードウェアや場所(エッジ、プライベート、クラウド)で使用する複雑な LLM アプリケーションを開発している開発者や組織向けです。リクエストのルーティング方法をプログラマブルに管理したい方におすすめです。
特徴
- プログラマブルルーティング: モデル選択をポリシーで実行可能にすることで、ハードコードされたロジックを回避します。
- 異種コンピューティング対応: GPU、アクセラレータ、エッジ、クラウドの混合環境をルーティング可能。
- モデルの混合: 異なるワークロードに応じてパーソナライズされたモデルパスを構成可能。
- プライバシー対応: ルーティングプロセス中にデータを特定の境界内に留めることが可能。
関連
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト
- Dispatch