Anthropic 可信 AI 代理框架與實作
Anthropic 推出了開發可信 AI 代理的全面方法,從簡單的聊天機器人轉向能執行程式碼、管理檔案並跨多個應用程式互動的自主系統。這種轉變提升了生產力,但也帶來了關鍵風險,特別是代理可能誤解使用者意圖,以及易受提示注入網路攻擊的威脅。
AI 代理的架構
AI 代理被定義為能自主規劃、執行、觀察與調整,以完成任務的模型,其運作於自我導向的循環中。Anthropic 指出,有四個關鍵元件決定了代理的能力與安全特性:
- 模型: 來自訓練過程的核心智慧,決定了推理與行為。
- 束縛(Harness): 模型運作時所遵循的一組指令與防護機制(例如:未經確認前絕不提交費用)。
- 工具: 模型可存取的外部服務與應用程式,例如電子郵件、行事曆或專業軟體。
- 環境: 代理執行的特定設定(例如企業筆電 vs. 個人手機),決定了資料存取範圍與代理行為的風險程度。
Anthropic 強調,安全不能僅依賴模型本身;即使訓練良好的模型,仍可能因束縛配置不佳、工具權限過於寬鬆或環境暴露而遭攻破。
建立可信原則的實作
Anthropic 在產品設計中應用五項核心原則——人類控制、與人類價值對齊、保護互動安全、透明度與隱私。
設計人類控制機制
為平衡自主性與安全性,Anthropic 實施分層監督機制:
- 細粒度權限: 在 Claude.ai 與 Claude Desktop 中,使用者可針對特定工具設定權限(例如:「一律允許」、「需審核」或「禁止」)。
- 計畫模式: 在 Claude Code 中引入此功能,讓使用者能在執行前審閱並編輯代理的完整行動計畫,將監督從單一步驟轉為整體策略。
- 子代理協調: 當代理開始委派任務給平行的子代理時,Anthropic 正研究協調模式,以確保這些複雜工作流程仍可被掌控且透明。
將代理目標與使用者意圖對齊
代理開發的主要挑戰在於釐清何時應自主行動,何時應暫停以求澄清。Anthropic 透過以下方式解決此問題:
- 情境訓練: 建立訓練情境,獎勵模型在模糊情況下停下來,而非做出假設。
- 憲法式 AI: 利用 Claude 的憲法強化模型在繼續前提出疑慮或尋求澄清的直覺。
研究顯示,在複雜任務中,Claude 向使用者確認的頻率約翻倍,展現此校準策略的有效性。
抵禦提示注入攻擊
提示注入發生於惡意指令隱藏在代理處理的資料中,可能誘使模型執行未授權動作。Anthropic 採用多層防禦策略:
- 模型訓練: 訓練模型識別並忽略注入模式。
- 流量監控: 監控生產環境流量,以阻擋真實世界的攻擊。
- 紅隊測試: 聘請外部專家進行壓力測試。
由於單一防禦無法絕對可靠,Anthropic 建議使用者根據環境的風險特徵,限制代理可使用的工具、資料與權限。
代理安全的生態系統級要求
Anthropic 主張,代理的可靠性無法由單一公司達成,需依靠產業共同的基礎設施:
- 標準化基準: 與 NIST 等機構合作,建立獨立驗證的基準,用於評估提示注入抵抗能力與不確定性揭露。
- 證據共享: 公開代理在哪些情境下表現不佳的資料,讓政策制定者更清楚了解實際應用狀況。
- 開放標準: 創建並後續捐贈 Model Context Protocol (MCP) 至 Linux Foundation 的 Agentic AI Foundation。這確保安全特性內建於基礎設施中,而非依賴個別部署的修補,並讓競爭焦點集中在代理品質,而非整合控制。
Sources
- OriginalTrustworthy agents in practice
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch