Claude Cookbook:代理工作流的實作指南
Claude Cookbook:代理工作流的實作指南
Claude Cookbook 是一個技術指南與實作範例的集中式儲存庫,旨在幫助開發者最大化 Claude 的效用。它提供了一種結構化的方法來構建複雜的 AI 系統,重點關注代理編排(agentic orchestration)、檢索增強生成(RAG)以及程式化工具整合。
進階代理編排與模式
Claude 的生態系統支援多種複雜的代理模式,這些模式超越了簡單的聊天介面,實現了自主任務執行。
多代理系統與協調
開發者可以實作異質的專家團隊。例如,本指南詳細介紹了一種協調器配置,該配置管理三個不同的專家——一個網頁搜尋研究員、一個檔案閱讀圖書館員和一個基於規則的定價員——以彙整複雜的交付成果,如銷售提案。
其他編排模式包括:
- Async Multi-Agent Orchestration:透過共享中心實作固定 N 個代理的團隊進行同儕訊息傳遞,或動態生成非同步子代理。
- Orchestrator-Workers:一個中央 LLM 動態地將任務委派給工作者 LLM 並綜合最終結果。
- Evaluator-Optimizer:一個迴圈,其中一個 LLM 生成內容,另一個提供評估回饋以進行迭代改進。
代理記憶與上下文管理
為了處理長期互動,本指南提供了維護狀態和降低 token 成本的策略:
- Session Memory Compaction:使用背景執行緒和 prompt caching 來壓縮對話歷史。
- Persistent Memory:利用記憶體儲存機制,讓代理能夠跨多個對話階段記住使用者偏好。
- Context Engineering:比較記憶體、壓縮和工具清除的策略,以優化長期運行的代理效能。
工具使用與程式化整合
Claude 的設計旨在透過多種工具調用機制與外部環境進行互動。
Programmatic Tool Calling (PTC)
PTC 允許 Claude 在程式碼執行環境中編寫程式碼來程式化地調用工具,與傳統的工具調用迴圈相比,這降低了延遲和 token 消耗。
專業化工具實作
本指南為幾種高價值的代理類型提供了藍圖:
- SRE and Incident Response:讀取日誌和運行手冊(runbooks)以精確定位根本原因並開啟修復 PR 的代理。
- Cybersecurity:對 C 目標進行威脅建模並搜尋記憶體安全漏洞的漏洞發現代理。
- Data Analysis:能夠在沙盒環境中使用 CSV 檔案生成帶有互動式圖表的敘述性 HTML 報告的代理。
- Threat Intelligence:自主調查入侵指標 (IOCs) 並將發現結果映射到 MITRE ATT&CK 框架的代理。
RAG 與知識檢索
除了基礎檢索外,本指南還探索了將 Claude 的回答與外部數據掛鉤的高級方法。
上下文檢索與知識圖譜
- Contextual Embeddings:透過在嵌入之前為數據塊添加上下文,並結合 prompt caching,來提高 RAG 的準確性。
- Knowledge Graph Construction:使用 Claude 進行實體提取和關係挖掘,從非結構化文本中構建圖譜,以進行多跳查詢。
- Text-to-SQL:使用 RAG 和思維鏈(chain-of-thought)技術將自然語言查詢轉換為 SQL。
評估與生產就緒性
將代理從原型轉向生產環境需要嚴格的評估和部署策略。
評估框架
本指南強調使用「結果」(Outcomes)——即能夠驗證自身工作的代理。這涉及一個「評分並修改」的迴圈,其中一個無狀態評分者根據準則檢查引文,驅動修改直到符合簡報要求。
生產部署
為了實現營運成熟度,指南涵蓋了透過三個層級部署代理的方法:Docker、Modal 和 Kubernetes。它還詳細介紹了生產環境特有的模式,例如由 vault 備份的 MCP 憑證,以及用於無需長期連接的人機協作(human-in-the-loop)互動的 session.status_idled webhook 模式。
社群觀點與批判性分析
雖然 Claude Cookbook 提供了大量的範例庫,但社群討論也指出了一些關於「AI 教科書」效用的爭議點。
「對我來說,幾乎每個『如何使用 AI』的資源都顯得毫無意義。我直接問 AI 怎麼做就好了……所有關於代理工作流、管理代理記憶、harness engineering 等等的資源,對我來說看起來就像是在演戲。」
其他開發者指出,提供的範例與現實世界的審美品質之間存在差距,特別是在前端開發方面。一些使用者認為,學習這些 harness 的最佳方式是透過直接實驗,而不是遵循靜態的食譜,而其他人則認為,這些模式最終會被「內建」到下一代模型本身中。