vLLM Semantic Router: マイクロエージェント協調によるモデル性能の向上

vLLM Semantic Router: マイクロエージェント協調によるモデル性能の向上

vLLMは、Semantic Routerというサービングレイヤーのプリミティブを導入し、単一のモデルAPIコールをトリガーして複数のモデルの有界な協調を開始し、モデルチームを単一のモデルアイデンティティとして効果的に扱います。このアプローチにより、アプリケーションレイヤーが複雑なエージェントグラフを管理することなく、タスク固有のコラボレーション「レシピ」を選択することで、フロンティアモデルの性能に匹敵またはそれを上回ることができます。

セマンティックルーターとしての機能レイヤー

バックエンドへのパッシブなパススルーとして機能するのではなく、vLLM Semantic Routerはアクティブなコントロールプレーンとして機能します。これは、コスト削減、セキュリティポリシーの適用、クラウドエッジ調整に焦点を当てていた従来のルーターの役割を変革し、機能構築のためのツールへと変えます。

安定したモデルアイデンティティ(例: vllm-sr/auto)を使用することで、ルーターはワーカーへのファンアウト、クォラムの収集、意見の不一致の検証、最終回答の合成などの複雑な内部プロセスを実行しながら、ユーザーに標準のOpenAI互換レスポンスを返すことができます。これにより、マルチモデルコラボレーションの複雑さがアプリケーションからサービングインフラストラクチャへ抽象化されます。

ルーパー: マイクロエージェントのための実行ランタイム

セマンティックルーターの中心には、「ルーパー」と呼ばれるランタイムがあり、これが境界を持ったマイクロエージェントを管理します。リクエストがルーターに入ると、タスクシェイプまたはリスクバンドに射影され、適切なルーパーアルゴリズムが決定されます。主なルーパーパターンには以下が含まれます:

  • Confidence: コストを意識したシーケンシャルエスカレーションループ。最初に安価なモデルを試し、信頼スコア(ログ確率、自己検証、または entailment verifier から導出)が特定の閾値を下回った場合のみ、より高価な候補にエスカレートします。
  • Ratings: max_concurrent キャップまで並行して複数の候補を起動する制御されたアンサンブルループ。評価を意識した重みを使用して結果を集約します。
  • ReMoM (Repeated Mixture-of-Model): 推論に焦点を当てたループ。複数の試行をファンアウトし、最小成功クォーラムを待ち、合成モデルを使用して証拠を最終出力契約にマージします。
  • Fusion: 不一致をシグナルとして扱うパターン。独立したパネルの回答をジャッジとファイナライザーに提供し、それらが矛盾と独自の洞察を分析して最終レスポンスを生成します。
  • Workflows: 静的な役割または動的なプランナーをサポートする境界のあるエージェントランタイム。ステップ数、並列性、タイムアウトの厳格な制限内でワーカーステップを実行し、システムが無限の自律エージェントではなくインフラストラクチャによって管理されるようにします。

最適化されたパフォーマンスのためのタスクシェイプドレシピ

パフォーマンスの向上は、タスクの特定の要件にコラボレーションパターンを合わせることで達成されます。vLLMは、最良のループは「タスクシェイプド」であると主張しており、これは異なるベンチマークが異なるレシピを必要とすることを意味します:

  • GPQA-Diamond: 硬科学の多肢選択問題に対して、ANSWER: X フォーマットを厳密に保持するReMoMレシピを使用します。
  • LiveCodeBench: 制約、スターターコード、および隠しテストリスクを評価するコードシェイプドループを採用します。
  • Humanity's Last Exam (HLE): 公式な推論と不一致リスクに基づいて、より深いReMoM、より小さなFusion、またはフォールバックパスの間から選択します。

ベンチマークパフォーマンス

評価によると、ルーター所有のコラボレーションは、任意の個別のモデルコールよりも強力なモデルアイデンティティを作り出すことができます。以下の結果は、VSR Closed(クローズドモデルバックエンドのみを使用)と VSR Hybrid(オープンモデルとクローズドモデルを混合)を比較しています:

ベンチマーク VSR 行 スコア 参照ベースライン
LiveCodeBench (Jan-Apr 2025) VSR Closed 92.6 Fugu Ultra (92.0), GPT-5.5 (90.7), Opus 4.8 (90.3)
GPQA-Diamond VSR Closed 96.0 Fugu Ultra (95.5), Gemini 3.1 Pro (94.3), GPT-5.5 (93.6)
Humanity's Last Exam VSR Closed 50.0 Fugu Ultra (50.0), Gemini 3.1 Pro (45.0)
Humanity's Last Exam VSR Hybrid 47.1 Qwen3.7 Max (41.4), GPT-5.5 (41.4)

モデルサービングインフラストラクチャへの影響

このシフトにより、モデルサービングはパッシブなスタックからアクティブなスタックへと移行します。ルーターは今、マイクロエージェントオーケストレーションの必須コンポーネントを管理します:モデルエイリアス、プロバイダーポリシー、認証情報、コストメタデータ、レスポンスセマンティクス。これらの機能をサービングレイヤーに統合することにより、vLLMはクライアントサイドの統合を変更することなく、システムの推論能力と効率を向上させることができます。

Sources