Tavily Deep Research: 在AI研究代理中实现最先进的水平
Tavily 已开发出一种最先进的研究代理,通过优先考虑上下文工程和代理自主性而非复杂的编排逻辑,在 DeepResearch Bench 上实现了顶级性能。该系统通过用线性蒸馏过程替换二次 token 传播,相比 Open Deep Research 将 token 消耗降低了 66%。
代理 harness 与模型演进
代理 harness 是管理上下文、工具调用、循环控制和错误处理的软件层。Tavily 构建此 harness 的方法侧重于通过限制手工优化和避免刚性假设来吸收未来模型性能的提升。
关键见解关于模型和工具演进包括:
- 模型能力:工具调用可靠性的最近改进将焦点从刚性工作流转移到了自主代理。Tavily 将高召回摘要、工具调用可靠性和写作简洁性视为未来模型演进的关键领域。
- 工具设计:有效的工具应在内部执行上下文工程,仅返回最相关的数据,而不是将大量 token 倾倒到上下文窗口。Tavily 的 "advanced search" 功能集成了此上下文工程以降低延迟和幻觉。
上下文工程与信息蒸馏
保持一个干净、优化的上下文窗口对于长期研究任务至关重要。Tavily 采用 "context-managed web retrieval" 策略,以防止代理在单一研究线程上过拟合并确保高效的信息收集。
模拟人类-网络交互
Tavily 的架构模拟了人类的研究行为:收集信息,将其提炼为关键洞察(反思),并仅将这些提炼的反思作为后续工具调用的上下文。原始信息仅在准备交付物的最终阶段重新引入,以防止信息丢失。
token 效率:线性 vs. 二次增长
传统的 ReAct 代理架构(如 LangChain 的 Open Deep Research)通常会在循环中传播所有工具调用和输出,导致二次 token 消耗,建模为:
$$n + 2n + 3n + dots + mn = n \cdot \frac{m(m + 1)}{2}$$
相比之下,Tavily 的蒸馏方法移除了这种传播,从而实现了线性 token 增长:
$$n + n + n + dots + n = nm$$
通过节省 $\frac{m + 1}{2}$ 倍的 token,Tavily 在 DeepResearch Bench 上实现了 state-of-the-art(SOTA)结果,同时将 token 消耗降低了 66%。
将自主代理投入生产
将研究代理部署到生产环境需要在自主性、可靠性和成本之间取得平衡。
针对非确定性的工程
由于 LLMs 具有非确定性,Tavily 将失败模式视为核心设计考虑。虽然工具调用重试和模型级联提供基本支持,但生产级代理需要主动预见异常,并通过提示和边缘情况测试来强化正确的推理模式。
工具集优化
Tavily 发现,一个小而精要的工具集比一个大而复杂的工具集更有效。过度设计工具集经常会引入新的失败模式,并使模型难以始终如一地选择正确的工具。
评估的作用
Tavily 将评估用于方向性反馈,而不是作为绝对的优化目标。由于 LLM-as-a-judge 评估具有非确定性,且长时间运行的代理耗时较长,团队更倾向于关注代理轨迹监控和直觉,而非数值基准分数。对于生产系统,可靠性、较低的延迟和减少的 token 使用比评估分数的微小提升更受重视。