単一モデルを超えて:vLLM Semantic Router で Mixture-of-Models システムを構築

単一モデルを超えて:vLLM Semantic Router で Mixture-of-Models システムを構築

TL;DR

vLLM Semantic Router は Mixture-of-Models (MoM) システムのサポートを追加し、断片化されたモデル、コンピューティング、場所、およびユーザーの好みの課題を、内部モデルシステムに変換します。このシステムは、1つのバージョン済みモデルアイデンティティを提示しながら、裏で独立したモデルをオーケストレーションします。

背景と動機

モデル、コンピューティング、場所、およびユーザーの好みの断片化により、各アプリケーションはこれらの違いを自分自身で調整しなければなりません。モデル境界をインテリジェントな割り当てを含むように移動させることで、割り当てをモデルの一部とし、断片化をシステム内部に保つことができます。

vLLM Semantic Router の進化

2025年4月のインキュベーションから2026年6月の Themis リリースまで、vLLM‑SR はシンプルな意図認識ルーティングから、プロジェクション、リプレイ、プロトコルサポートを備えたステートフル、セッション認識制御へと進化しました。Iris リリースではコンポーザブルルーティングと MoM モデルファミリーが導入され、Athena ではモデル選択、メモリ、RAG、マルチモダリティ、およびオペレーティングダッシュボードが追加されました。Themis では、セッション認識エージェンティックルーティング、リプレイ可能なトレース、およびクロスハードウェアサポートを備えたオペラブルコントラクトにシステムが変換されました。

Mixture-of-Models とは

Mixture-of-Models は、バージョン済みの合成モデルであり、そのエンジンは独立したモデルとオペレーター間の好み条件付き、リソース境界付きパスを通じて各リクエストを実現し、1つのモデルインターフェースを通じて提示し、1つの帰属可能な結果を返します。Mixture‑of‑Experts とは異なり、MoM はアーキテクチャ、所有者、ライセンス、モダリティ、プロトコル、コンテキストウィンドウ、およびハードウェアが異なる独立したモデルを調整します。MoE チェックポイントは MoM のコンポーネントとなる可能性があります。

項目 従来のモデル Mixture-of-Models
知能の単位 1つのチェックポイント モデルの統治システム
専門性 主に重みにエンコード 独立したスペシャリスト間で構成
実行 1つの生成パス 選択、カスケード、検証、融合、またはワークフロー
最適化ターゲット 1つのモデルの品質と効率 品質、コスト、レイテンシ、安全性、プライバシー、エネルギーにおけるシステムフロンティア
デプロイ境界 1つのランタイム クラウド、データセンター、およびエッジ
ユーザーコントラクト 1つのモデルアイデンティティ 1つのモデルアイデンティティ

モデル境界を移動させる必要性

モデル、コンピューティング、場所、およびユーザーの好みはそれぞれ断片化されており、単一のモデルがすべての次元で勝つことはありません。今日では、各アプリケーションがこれらの断片を自分で結合しなければなりません。MoM はその責任を1つのモデル境界の裏側に移動し、インテリジェントな割り当てをモデルの一部とすることで、アプリケーションは1つのモデルアイデンティティしか見ず、システム内部で作業をルーティングし、ポリシーを適用し、モデルを調整します。

MoM の4つのプレーン

完全な MoM は、アーティファクト、学習、実行、および物理的実現の4つのプレーンにわたります。

  • アーティファクト はコンポーネント、能力、目的、ポリシー、評価契約、および由来を所有します。vLLM‑SR の基盤には、 canonical コンフィグ、モデル参照、DSL、バージョン済みポリシーが含まれます。次のステップは、ポータブルな MoM インポート/エクスポート仕様です。
  • 学習 はルーター所有モデル、好み、結果、およびレシピ改善を所有します。基盤にはトレーニングスタック、ルーターラーニング、リプレイ、および結果 API が含まれます。次のステップは、共同トレーニングとシステムレベルのリリースゲートです。
  • 実行 はシグナル、プロジェクション、意思決定、セレクター、ループャー、およびプラグインを所有します。基盤には Signal–Decision ランタイム、Fusion、ReMoM、ワークフロー、安全およびメモリが含まれます。次のステップは、ライフサイクル認識の MoM エンジンです。
  • 物理 はプロバイダー、モデルプール、アクセラレータ、ローカリティ、キャッシュ、およびエネルギー状態を所有します。基盤には vLLM バックエンド、クラウドプロバイダー、ROCm、CUDA、OpenVINO、および CPU が含まれます。次のステップは、クラウド、データセンター、エッジ、およびローカルデバイス間でのポータブルな配置です。

デプロイでは、以下の4つのオブジェクトを使用します:バンドル(インターフェース、グラフ、ポリシー、動作バリアント、境界、および不変のセマンティックアセットを固定)、バインディング(論理コンポーネントを意思決定の意味を変更せずに適切なデプロイメントにマッピング)、解決ロック(構成要素のリビジョン、ランタイム、イメージ、アクセラレータ、およびプロバイダー観測を凍結)、およびランレコード(バンドル、バインディング、およびロックに対して、すべての決定、呼び出し、制約チェック、コスト、および結果を属性付け)。

vLLM‑SR が MoM エンジンとして機能

トレーニング、評価、および推論は1つの契約を共有しなければなりません。そうでなければ、研究、ベンチマーク、および本番環境がずれてしまいます。

重みだけでなくトレーニングの割り当て

MoM トレーニングは、ルーター所有のエンベディング、シグナルエンコーダ、好みおよび安全モデル、およびセレクターをカバーします。また、割り当てとコラボレーションも学習します:どのパスがワークロードと予算に適合するか、カスケードをいつ停止すべきか、パネルがどのように判断または合成すべきか、およびエージェントセッションがいつモデルを切り替えるべきか。進捗は、すべての構成要素を通じた勾配を必要とせず、トレースと結果から最適化できます。

MoM を1つのモデルとして評価

評価は、モデルアイデンティティに対してエンドツーエンドでスコアリングしなければなりません。バックエンドベンチマークは入力であり、結果ではありません。バージョン済みスコアカードは、ルーティングの後悔、コラボレーションの利益、回復、セッション継続性、テールレイテンシ、コスト、安全性、プライバシー、およびエネルギーを測定すべきです。プロバイダーの障害、デバイスの損失、モデルの不一致、ワークロードのドリフト、および好みの変化に対するストレステストを行うべきです。各宣言された動作ポイントには独自のテストが必要です:flash はレイテンシ‑品質フロンティア上、light は品質フロアに対して、ultra は予算内で行います。

推論時のインテリジェンスの実行

推論時には、エンジンは1つのモデルで十分かどうかを決定します。ローカルスペシャリストを選択し、ウォームセッションを保持し、信頼カスケードを通じてエスカレートし、取得または検証を要求し、Fusion パネルを実行するか、または境界付きワークフローを実行する可能性があります。ランタイムは予算、トポロジー、フォールバック、トレース、およびレスポンス契約を所有し、アプリケーションは通常のモデル呼び出しを行います。

移動できる1つのモデル

目標は、構築、エクスポート、インポート、バージョン管理、評価、デプロイ、および呼び出しが統合モデルとして行える完全な MoM です。論理仕様は不変のバンドルにコンパイルされ、環境にバインドされ、具体的なデプロイメントに解決され、サービングと評価のために同じアイデンティティを保持します。

アーティファクトは、開発者マシン、プライベートクラスター、クラウドフリート、およびエッジ環境で実行できるべきであり、その物理的実現は変化します。プロジェクトはすでに ROCm、CUDA、OpenVINO、および CPU をまたぐパスをサポートしており、ハードウェアの能力と配置は MoM コントラクトの一部となるでしょう。

ユーザーエクスペリエンスの標準はシンプルです:

1つのモデルアイデンティティ。多くのモデル。あらゆるハードウェア。

今何が変わるか

次のステージは、4つの関連分野に焦点を当てます:

  1. コンポーネント、目的、ポリシー、好み、評価、制約、および実行セマンティクスを1つのバージョン済みアーティファクトにパッケージ化するポータブルな MoM 仕様を定義します。
  2. 評価とリプレイからモデルとレシピを改善し、レビュー可能でロールバック安全なリリースを通じてそれらを出荷することにより、トレーニング‑評価‑推論ループを閉じます。
  3. ハードウェア、ローカリティ、エネルギー、およびデータ境界を入力として、クラウド、データセンター、およびエッジ全体にわたる1つの MoM をマッピングするヘテロジニアスランタイムを構築します。
  4. モデルインターフェースを退屈に保ち、MoM が単一モデルと同じくらい簡単にインポート、デプロイ、および呼び出しできるようにします。

一緒に構築しましょう

Mixture-of-Models の構築には、モデルトレーニング、評価、サービングシステム、ハードウェア、および本番運用での作業が必要です。プロジェクトは、学習された割り当て、好みの最適化、モデル協力、エネルギー認識推論、ポータブルアーティファクト、オープン評価、およびヘテロジニアスランタイムへの貢献を求めています。

これらの問題に取り組んでいる場合は、私たちはあなたのワークロードと測定から学びたいと考えています。動作ポイントを構築し、ランタイムを追加し、コラボレーションレシピをテストするか、構成が失敗するケースを公開してください。

謝辞リストには、MBZUAI、マギル大学、Mila、ライス大学のエンジニア、および多くの企業とオープンソースコミュニティからの貢献者とコラボレーターが含まれています。プロジェクトは現在、1,734 コミットと 150 人以上の貢献者を達成しています。

GitHub で参加し、ドキュメントを探索し、Hugging Face で MoM モデルファミリーを試し、vLLM Slack の #semantic‑router チャンネルでコミュニティと会ってください。

vLLMllM Semantic Router は、インフラストラクチャが各リクエストに適したモデルを選択的ルーターは、インフラストラクチャが各リクエストに適したモデルを選択するのを助けることから始まりました。今では、その基盤を単一モデルを超えて拡張し、デバイスと環境をまたがって複数のモデルを調整、評価、および運用できるシステムに向かっています。

オープンでこのアプローチの構築とテストにコミュニティの参加をお招きします。

Sources