Tavily Deep Research:在 AI 研究代理領域實現頂尖技術
Tavily 開發了一款頂尖的研究代理,透過優先考慮上下文工程(context engineering)與代理自主性,而非複雜的編排邏輯,在 DeepResearch Bench 上取得了卓越的表現。透過將二次方級別的 Token 傳播替換為線性蒸餾過程,該系統與 Open Deep Research 相比,減少了 66% 的 Token 消耗。
代理框架與模型演進
代理框架(agent harness)是管理上下文、工具調用、迴圈控制與錯誤處理的軟體層。Tavily 構建此框架的方法著重於透過限制手工優化並避免僵化的假設,來吸收未來模型的性能增長。
關於模型與工具演進的關鍵洞察包括:
- 模型能力:工具調用可靠性的近期提升,已將焦點從僵化的工作流轉向自主代理。Tavily 將高召回率摘要、工具調用可靠性以及寫作簡潔性視為未來模型演進的關鍵領域。
- 工具設計:有效的工具應在內部執行上下文工程,僅回傳最相關的數據,而不是將大量 Token 丟入上下文窗口。Tavily 的「advanced search」功能整合了這種上下文工程,以降低延遲與幻覺。
上下文工程與資訊蒸餾
對於長程研究任務而言,維持一個乾淨且優化的上下文窗口至關重要。Tavily 採用「上下文管理的網路檢索」策略,以防止代理對單一研究線索產生過擬合,並確保高效的資訊收集。
模擬人機網路互動
Tavily 的架構模仿了人類的研究行為:收集資訊、將其蒸餾為關鍵洞察(reflections),並僅使用這些蒸餾後的洞察作為後續工具調用的上下文。原始資訊僅在準備最終交付成果的最後階段重新引入,以防止資訊遺失。
Token 效率:線性 vs. 二次方增長
傳統的 ReAct 代理架構(例如 LangChain 的 Open Deep Research)通常會在迴圈中傳播所有的工具調用與輸出,導致二次方級別的 Token 消耗,模型化表示為:
$$n + 2n + 3n + \dots + mn = n \cdot \frac{m(m + 1)}{2}$$
相比之下,Tavily 的蒸餾方法消除了這種傳播,實現了線性的 Token 增長:
$$n + n + n + \dots + n = nm$$
透過節省 $\frac{m + 1}{2}$ 倍的 Token,Tavily 在 DeepResearch Bench 上取得頂尖(SOTA)結果的同時,將 Token 消耗降低了 66%。
代理的生產化應用
將研究代理部署到生產環境需要平衡自主性、可靠性與成本。
針對非確定性的工程設計
由於 LLM 具有非確定性,Tavily 將失敗模式視為核心設計考量。雖然工具調用重試與模型級聯(model cascades)提供了基礎支持,但生產級代理需要主動預測異常,並透過提示詞(prompting)與邊緣案例測試來強化正確的推理模式。
工具集優化
Tavily 發現,精簡且核心的工具集比龐大複雜的工具集更有效。過度設計工具集往往會引入新的失敗模式,並使模型更難夠穩定地選擇正確的工具。
評估的作用
Tavily 利用評估來獲取方向性回饋,而非將其作為絕對的優化目標。由於 LLM-as-a-judge 評估的非確定性以及長時運行代理的耗時特性,團隊優先考慮代理追蹤(agent-trace)監控與直覺,而非數值基準分數。對於生產系統而言,可靠性、低延遲與降低 Token 使用量比評估分數的微幅提升更具價值。