Tavily Deep Research: AI研究エージェントにおける最先端の達成
Tavilyは、複雑なオーケストレーションロジックよりもコンテキストエンジニアリングとエージェントの自律性を優先することにより、DeepResearch Benchで最高のパフォーマンスを達成する最先端の研究エージェントを開発しました。このシステムは、二次的トークン伝播を線形蒸留プロセスに置き換えることにより、Open Deep Researchと比較してトークン消費量を66%削減します。
エージェントハーネスとモデルの進化
エージェントハーネスは、コンテキスト、ツールの呼び出し、ループ制御、エラー処理を管理するソフトウェアレイヤーです。Tavilyは、このハーネスを構築する際、手作りの最適化を制限し、厳格な仮定を避けることにより、将来のモデル性能向上を吸収することに焦点を当てています。
モデルとツールの進化に関する重要な洞察は以下の通りです:
- モデル機能: ツール呼び出しの信頼性の最近の改善により、焦点が厳格なワークフローから自律エージェントへとシフトしました。Tavilyは、高再現率の要約、ツール呼び出しの信頼性、および執筆の簡潔さを、今後のモデル進化における重要な分野として特定しています。
- ツール設計: 効果的なツールは、コンテキストウィンドウに大量のトークンをダンプするのではなく、内部でコンテキストエンジニアリングを行い、最も関連性の高いデータのみを返すべきです。Tavilyの「高度な検索」機能は、このコンテキストエンジニアリングを統合することにより、レイテンシーと幻覚を削減します。
コンテキストエンジニアリングと情報蒸留
クリーンで最適化されたコンテキストウィンドウを維持することは、長期的な研究タスクにおいて重要です。Tavilyは、「コンテキスト管理型ウェブ検索」という戦略を採用し、エージェントが単一の研究スレッドに過剰適合することを防ぎ、効率的な情報収集を確保します。
ヒューマン-ウェブ相互作用のモデリング
Tavilyのアーキテクチャは、人間の研究行動を模倣しています:情報を収集し、それを重要な洞察(反映)に蒸留し、その後のツール呼び出しのコンテキストとしてのみその蒸留された洞察を使用します。生の情報は、情報損失を防ぐために、成果物を準備する最終段階でのみ再導入されます。
トークン効率:線形 vs. 二次増加
LangChainのOpen Deep Researchなどの従来のReActエージェントアーキテクチャは、通常、ループ内ですべてのツール呼び出しと出力を伝播させ、これにより二次的なトークン消費が発生し、次のようにモデル化されます:
$$n + 2n + 3n + \dots + mn = n \cdot \frac{m(m + 1)}{2}$$
対照的に、Tavilyの蒸留法はこの伝播を除去し、線形トークン増加をもたらします:
$$n + n + n + \dots + n = nm$$
$\frac{m + 1}{2}$ の因子でトークンを節約することにより、TavilyはDeepResearch Benchで最先端(SOTA)の結果を達成しながら、トークン消費量を66%削減しました。
自律エージェントの本番環境への導入
研究エージェントを本番環境に導入するには、自律性、信頼性、コストのバランスを取る必要があります。
非決定性へのエンジニアリング
LLMは非決定的であるため、Tavilyは失敗モードを核となる設計考慮事項として扱います。ツール呼び出しのリトライとモデルカスケードは基本的なサポートを提供しますが、本番レベルのエージェントは、異常を積極的に予測し、プロンプトとエッジケーステストを通じて適切な推論パターンを強化する必要があります。
ツールセットの最適化
Tavilyは、小規模かつ必須のツールセットが、大規模で複雑なツールセットよりも効果的であることを発見しました。ツールセットの過剰設計は、しばしば新たな失敗モードを導入し、モデルが正しいツールを一貫して選択することを困難にします。
評価の役割
Tavilyは、評価を絶対的な最適化目標ではなく、方向性フィードバックとして利用します。LLM-as-a-judge評価の非決定的な性質と、長時間実行されるエージェントの時間集約的な性質により、チームは数値ベンチマークスコアよりもエージェントトレースの監視と直感を優先します。本番システムでは、評価スコアのわずかな増加よりも、信頼性、低レイテンシー、トークン使用量の削減が重視されます。