vllm-project/semantic-router

A programmable Mixture-of-Models router for heterogeneous LLM inference

何を解決するか

vLLM Semantic Router は、分散した LLM インフラの問題を解決するように設計されています。アプリケーションにルーティングロジックをハードコードするのではなく、開発者が「モデルの混合(Mixture-of-Models)」システムを管理できるプログラマブルなレイヤーを提供します。これにより、特定のシグナルやポリシーに基づいて各リクエストに適したモデルパスを選択することで、品質、コスト、レイテンシ、プライバシーを最適化できます。

動作方法

このシステムは、リクエストのシグナル、ユーザーの好み、アプリケーションポリシーを評価してモデルパスを選択または構成するルーティングレイヤーとして機能します。GPU、アクセラレータ、エッジデバイス、クラウドインフラなど、異種のコンピューティング環境間でリクエストをルーティング可能であり、プライバシーを保つためにデータ境界を維持します。

対象ユーザー

複数のモデルを異なるハードウェアや場所(エッジ、プライベート、クラウド)で使用する複雑な LLM アプリケーションを開発している開発者や組織向けです。リクエストのルーティング方法をプログラマブルに管理したい方におすすめです。

特徴

  • プログラマブルルーティング: モデル選択をポリシーで実行可能にすることで、ハードコードされたロジックを回避します。
  • 異種コンピューティング対応: GPU、アクセラレータ、エッジ、クラウドの混合環境をルーティング可能。
  • モデルの混合: 異なるワークロードに応じてパーソナライズされたモデルパスを構成可能。
  • プライバシー対応: ルーティングプロセス中にデータを特定の境界内に留めることが可能。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • Dispatch