Anthropic 多智能体研究系统架构
Anthropic 为 Claude 实现了一套多智能体研究系统,通过协调一个主编排器智能体与多个专门的子智能体,使模型能够执行复杂的、开放式的研究任务。这种架构允许 Claude 扩展其推理能力和 Token 使用量,与单智能体 Claude Opus 4 系统相比,在使用多智能体设置(Claude Opus 4 作为主导,Claude Sonnet 4 作为子智能体)时,其在内部研究评估中的性能提升了 90.2%。
編排器-工作者架构
该研究系统采用编排器-工作者(orchestrator-worker)模式,以超越传统检索增强生成(RAG)的静态检索。该系统并非获取静态的数据块,而是采用动态的多步搜索过程。
研究工作流
- 主研究员(编排器): 分析用户查询,制定战略计划,并将此计划保存到 Memory 中,以确保在上下文窗口(超过 200,000 tokens)被截断时能够保持持久性。
- 子智能体(工作者): 主智能体生成多个专门的子智能体,以并行探索查询的不同方面。这些子智能体使用搜索工具,应用交错思维(interleaved thinking)来评估结果,并将发现结果返回给主智能体。
- 合成: 主智能体综合子智能体的发现,并确定是否需要进一步研究。如果需要,它会改进策略或生成额外的子智能体。
- 引用智能体: 一旦研究循环完成,专门的 CitationAgent 会处理报告,以确保所有主张都正确地归因于其来源。
性能的技术驱动因素
Anthropic 对 BrowseComp 评估的分析显示,Token 使用量是性能的主要驱动因素,解释了结果中 80% 的方差。多智能体系统通过将工作分配到不同的上下文窗口中来有效地扩展 Token 使用量,从而为并行推理提供必要的容量。
并行化增益
为了降低延迟,系统采用了两个层级的并行化:
- 智能体并行化: 主智能体同时启动 3-5 个子智能体,而不是按顺序启动。
- 工具并行化: 子智能体并行执行三个或更多工具调用。
这些优化为复杂查询减少了高达 90% 的研究时间。
智能体提示工程原则
由于多智能体系统引入了协调复杂性,Anthropic 利用特定的提示启发式方法来稳定智能体行为:
- 委派指导: 提示主智能体为子智能体提供清晰的目标、输出格式、工具指导和严格的任务边界,以防止重复劳动。
- 工作量扩展: 提示词中包含明确的规则,使资源分配与查询复杂度相匹配(例如,简单的实事需要 1 个智能体和 3-10 次工具调用;复杂的研究可能需要 10 个以上的子智能体)。
- 搜索策略: 指示智能体“先广后精”,在深入细节之前先使用宽泛的查询。
- 自我改进: 使用 Claude 4 模型作为提示工程师来诊断失败模式并重写工具描述,这使得任务完成时间减少了 40%。
- 思维过程: 系统利用“扩展思维”(Extended Thinking)进行主智能体的计划,并利用“交错思维”(Interleaved Thinking)为子智能体评估工具结果并识别差距。
评估与可靠性挑战
评估多智能体系统很困难,因为智能体可能会采取不同的有效路径来达到同一个目标。Anthropic 采用了一种三层评估策略:
小样本测试: 使用约 20 个真实世界的查询进行快速迭代,以发现提示词微调带来的剧烈影响。
LLM-as-Judge: 通过单次 LLM 调用,根据涵盖事实准确性、引用准确性、完整性、来源质量和工具效率的评分标准来评估输出。
**人机评估:
- 手动测试以识别边缘情况,例如智能体倾向于偏好 SEO 优化的内容而非权威的学术 PDF。
生产工程
为了从原型转向生产,Anthropic 实施了若干可靠性措施:
- 状态恢复: 由于智能体是有状态的,且错误会不断累积,系统可以从失败点恢复,而不是重新开始。
- 彩虹部署(Rainbow Deployments): 为了避免在更新期间中断长时间运行的智能体进程,流量会从旧版本逐渐转移到新版本。
- 可观测性: 使用全量生产追踪来监控决策模式和交互结构,以诊断为什么智能体无法找到信息。
局限性与使用场景
多智能体系统并不普遍适用。它们不太适合于智能体之间具有高度相互依赖性或需要共享上下文的任务,例如大多数编程任务。它们在涉及重度并行化和信息量超过单个上下文窗口的高价值任务中最为有效。
从经济角度来看,这些系统的资源消耗很大;多智能体系统使用的 Token 数量大约是标准聊天交互的 15 倍,是单智能体交互的 4 倍。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch