エージェントシステムにおけるモデルルーティング:分類から最適化へ
エージェントシステムにおけるモデルルーティング:分類から最適化へ
エージェントシステムにおけるモデルルーティングは、単純な分類タスクではなくシステム最適化問題です。効果的なルーティングは、モデルの価格設定、キャッシュの動作、インフラストラクチャの状態、コンプライアンス制約の相互作用をバランスさせ、全体システムにとって最適な動作点を見つけることを必要とします。
モデルコストの隠れた複雑さ
実際の運用コストは、モデル、ワークロード、および提供インフラストラクチャの相互作用によって決定され、これによりステッカー価格はルーティングの意思決定において信頼できない指標となります。
AppWorld Test Challenge の 417 タスクで CodeAct エージェントを使用したテストでは、Claude Sonnet 4.6 の総コストは 79 ドル(タスクあたり 0.19 ドル)で、GPT-4.1 は 155 ドル(タスクあたり 0.37 ドル)でした。これは、GPT-4.1 がトークン価格が低く、Sonnet が推論ステップを約 3 倍必要とするにもかかわらず起こりました。この差はキャッシュによって引き起こされました:Sonnet のキャッシュ読み取り価格が低いため、コンテキストの大きなチャンクをステップ間で再利用するエージェントワークロードの有効入力コストが大幅に削減されました。
タスク難易度が不完全なシグナルである理由
推定されたタスク難易度のみに基づくルーティングは、難易度がリクエストの開始時にしばしば見えなく、他の本番制約とバランスを取る必要があるため失敗します。
- 見えない難易度: 「この契約を要約して」のような見かけ上単純なリクエストでも、取得、コンプライアンスチェック、複数の改良ラウンドを含む複雑な内部プロセスを引き起こす可能性があり、実際の難易度は実行時にのみ明らかになります。
- システム的制約: エンタープライズ環境では、ルータはデータ居住ルール、プライバシー制約、コンプライアンス要件、および承認されたモデルリストとともに、品質とコストのバランスを取る必要があります。
モデル速度を超えたレイテンシ
エンドツーエンドのレイテンシは、モデル自体の生の速度よりも、インフラストラクチャとルーティングオーバーヘッドによってより大きく影響を受けます。
応答時間を左右する要因には、ハードウェア仕様、キャッシュの温度、およびエンドポイントの混雑が含まれます。さらに、ルーティングの粒度はトレードオフをもたらします:タスクごとに1回ルーティングするとオーバーヘッドは最小限になりますが、実行の各ステップでルーティングすると柔軟性が高まりますが、運用の複雑さとレイテンシが増加するコストがかかります。
最適化ベースのルーティングアプローチへの移行
ルーティングを多目的最適化問題として扱うことで、単一の固定された決定ではなく、柔軟なコスト-精度のフロンティアを得ることができます。
IBM Research は、「このタスクに最適なモデルはどれか?」という問いから、コスト、品質、レイテンシを同時に最適化するアルゴリズムへとシフトしました。CodeAct エージェントを使用した AppWorld Test Challenge でのテストにより、このアプローチがさまざまな動作点を提供することが示されました:
- レイテンシ最適化構成: 93 ドルと 83 秒で 84% の精度を達成し、Opus 単独使用と比較してコストが 21% 削減、レイテンシが 9% 削減され、精度の低下はわずか 4% です。
- 効率: 最適化プロセスは軽量で、タスクあたり約 6 ミリ秒と 2 kB のメモリを必要とし、ルーターがシステムのボトルネックにならないことを保証します。
標準的な難易度ベースのルータは類似の精度範囲に到達するかもしれませんがコストが高くなるのに対し、最適化ベースのアプローチはトレードオフスペース全体をより効果的に探索します。
結論:システム最適化としてのルーティング
モデルルーティングは、特定のタスクに対して「最良」のモデルを選択することではなく、全体システムにとって最良の動作点を見つけることが主な目的です。モデルは、キャッシュの動作、インフラストラクチャの状態、ワークロードパターンのうちの単一の変数に過ぎません。