Weave Router 2.0: コーディングエージェント向けオープンソースモデルルーティング

Weave Router 2.0は、主要なコーディングベンチマークにおいてGPT-6 Astraのようなフロンティアモデルと同等の性能を達成しつつ、運用コストとレイテンシを大幅に削減します。タスクの複雑さに応じてLLMをインテリジェントに切り替えることで(複雑なシステム設計には高性能モデル、単純な更新には軽量モデルを使用)、精度と効率のトレードオフを最適化します。

パフォーマンスベンチマーク

Weave Router 2.0は、Terminal Bench 4.0およびSWE Atlasを使用してGPT-6 Astraと比較テストされました。その結果、アンサンブルアプローチは単一のフロンティアモデルの合格率に匹敵しつつ、大幅な効率向上を実現していることが示されました。

ベンチマーク 合格率 Astraとのコスト比較 Astraとの速度比較
Terminal Bench 4.0 同等 52% 2.2倍高速
SWE Atlas 同等 54% 2.5倍高速

技術アーキテクチャ

コーディングエージェントセッションにおけるルーティングの決定は複雑です。なぜなら、100ターンのやり取りと10個の利用可能なモデルがある典型的なセッションでは、潜在的なパスの探索空間が膨大になるためです。これを管理するために、Weave Router 2.0は3つの主要な技術的改善を採用しています。

隠れマルコフモデル (HMM) と分類器

強化学習 (RL) を通じてルーティング空間を完全に探索する際の法外なコストを避けるため、システムは隠れマルコフモデルを使用してセッションの状態を追跡します。このHMMにより、ルーターは現在のセッション状態だけでなく、その状態に至った歴史的な軌跡も理解できるようになります。次に、分類器がこのセッション状態を類似モデルの特定の「バケット」にマッピングし、与えられたコンテキストで効果的である可能性が低いモデルを除外することで、探索空間を効果的に剪定します。

合成データブートストラップ

ルーターは、フロンティアLLMを活用して、より大規模で多様なコーディングエージェントセッションにラベルを付けます。この合成データは、HMMと分類器の両方をブートストラップするために使用され、ルーティングロジックのRLコンポーネントに対してより豊かな報酬信号を提供します。

キャッシュエビクションの影響計算

コストを最小限に抑えるため、ルーターにはモデル切り替えの期待値を計算するサブシステムが含まれています。モデルの切り替えは、新しいモデルのプロンプトキャッシュを再充填するために高い一時的コストが発生することが多いため、ルーターは、より高性能なモデルを使用することによる予測利益がキャッシュエビクションのコストを上回る場合にのみ切り替えを実行します。

コミュニティの洞察と考察

発表後、開発者コミュニティからモデルルーターの実装と評価に関するいくつかの技術的な検討事項が提起されました。

  • 性能の天井: 一部のユーザーは、フロンティアモデルによってラベル付けされたデータでトレーニングされたルーターが、それらのモデル自体の性能を超えることができるのか疑問を呈しており、主な利点は純粋な能力の向上ではなくコスト削減にあるのではないかと指摘しています。
  • 既存ツールとの比較: ユーザーは、特にアーキテクチャ設計やコードレビューにおいて、Claude Codeの「アドバイザーモード」(Sonnet 5.5とFableアドバイザー)やCopilotの「HydraFusion」システムなど、他のマルチモデルシステムとルーターをベンチマークすることを提案しました。
  • 状態追跡: 探索空間の数学的表現に関して議論があり、ルーティングの決定は通常、100ターンのあらかじめ決定されたパスではなく、逐次的(ターンごと)に行われるものであるという指摘がありました。
  • キャッシュ効率: モデルを頻繁に切り替える際にキャッシュされない入力トークンが増加する可能性があり、それが全体的なコスト削減の主張に影響を与える可能性があるという懸念が提起されました。

Weave Routerは、GitHub上のオープンソースプロジェクトとして、またホスト型サービスとして利用可能です。

Sources

関連