Anthropic 多代理研究系統架構

Anthropic 為 Claude 開發了一套多代理研究系統,透過協調一個主導編排代理(lead orchestrator agent)與多個專業化的子代理(specialized subagents),使模型能夠執行複雜且開放式的研究任務。這種架構允許 Claude 擴展其推理能力與 Token 使用量,與單一代理的 Claude Opus 4 系統相比,在使用多代理設置(Claude Opus 4 作為主導,Claude Sonnet 4 作為子代理)時,內部研究評估的性能提升了 90.2%。

編排者-工作者架構

研究系統採用編排者-工作者(orchestrator-worker)模式,以超越傳統檢索增強生成(RAG)的靜態檢索。該系統並非僅僅獲取靜態的數據塊,而是採用動態、多步驟的搜尋過程。

研究工作流程

  1. 主導研究員(編排者): 分析使用者查詢,制定策略計畫,並將此計畫儲存至 Memory 中,以確保在上下文窗口(超過 200,000 tokens)被截斷時仍能保持持久性。
  2. 子代理(工作者): 主導代理會生成多個專業化的子代理,以並行地探索查詢的不同面向。這些子代理使用搜尋工具,應用交錯式思考(interleaved thinking)來評估結果,並將發現回傳給主導代理。
  3. 綜合分析: 主導代理會綜合子代理的發現,並判斷是否需要進一步研究。如果是,它會優化策略或生成額外的子代理。
  4. 引用代理: 一旦研究迴圈完成,專門的 CitationAgent 會處理報告,以確保所有主張都正確地歸因於其來源。

性能的技術驅動因素

Anthropic 對 BrowseComp 評估的分析顯示,Token 使用量是性能提升的主要驅動因素,解釋了結果中 80% 的變異量。多代理系統透過將工作分配到不同的上下文窗口中來有效地擴展 Token 使用量,為並行推理提供必要的容量。

並行化增益

為了降低延遲,系統採用了兩個層級的並行化:

  • 代理並行化: 主導代理會同時啟動 3-5 個子代理,而非循序執行。
  • 工具並行化: 子代理會並行執行三個或更多的工具呼叫。

這些優化措施為複雜查詢減少了高達 90% 的研究時間。

代理的提示工程原則

由於多代理系統會引入協調複雜度,Anthropic 利用特定的提示啟發式方法(prompting heuristics)來穩定代理行為:

  • 委派指導: 主導代理會收到提示,要求為子代理提供清晰的目標、輸出格式、工具指導以及嚴格的任務邊界,以防止重複勞動。
  • 投入規模化: 提示包含明確的規則,以根據查詢複雜度來匹配資源分配(例如:簡單事實需要 1 個代理與 3-10 次工具呼叫;複雜研究可能需要 10 個以上的子代理)。
  • 搜尋策略: 指導代理「先廣泛搜尋,再縮小範圍」,在深入研究細節之前,先使用廣泛的查詢。
  • 自我改進: 使用 Claude 4 模型作為提示工程師,來診斷失敗模式並重寫工具描述,這使得任務完成時間減少了 40%。
  • 思考過程: 系統利用主導代理的「延伸思考」(Extended Thinking)進行規劃,並利用子代理的「交錯式思考」(Interleaved Thinking)來評估工具結果並識別缺口。

評估與可靠性挑戰

評估多代理系統很困難,因為代理可以透過不同的有效路徑來達成相同的目標。Anthropic 採用了三層級的評估策略:

  1. 小樣本測試: 使用約 20 個真實世界的查詢來進行快速迭代,以發現提示微調帶來的顯著影響。
  2. LLM-as-Judge: 使用單次 LLM 呼叫來根據評估準則(涵蓋事實準確性、引用準確性、完整性、來源品質與工具效率)來評估輸出結果。
  3. 人為評估: 手動測試以識別邊際案例,例如代理傾向於偏好 SEO 優化的內容而非具備權威性的學術 PDF。

生產工程

為了從原型轉向生產環境,Anthropic 實施了幾項可靠性措施:

  • 狀態恢復: 由於代理是具有狀態的(stateful),且錯誤會不斷累積,系統可以從失敗點恢復,而非重新開始。
  • 彩虹部署(Rainbow Deployments): 為了避免在更新期間中斷長時間運行的代理程序,流量會從舊版本逐漸轉移到新版本。
  • 可觀測性: 使用完整的生產環境追蹤(production tracing)來監控決策模式與互動結構,以診斷為什麼代理無法找到資訊。

限制與使用案例

多代理系統並不適用於所有情況。它們並不適合處理代理間具有高度相互依賴性或需要共享上下文的任務,例如大多數的編碼任務。它們在涉及大量並行化且資訊量超過單一上下文窗口的高價值任務中效果最為顯著。

在經濟層面上,這些系統是資源密集型的;多代理系統使用的 Token 數量大約是標準聊天互動的 15 倍,且是單一代理互動的 4 倍。

Sources

相關