Anthropic 安全且值得信賴的 AI Agent 框架

Anthropic 已發布了一個用於開發安全且值得信賴的 AI agent 的早期框架。此框架建立了一套指導原則,旨在確保當 AI 從被動助手轉向能夠獨立追求複雜目標的自主 agent 時,仍能與人類價值觀保持一致,並處於人類的監督之下。

平衡 Agent 自主性與人類控制

即使 agent 在自主運作時,也必須維持人類監督,以防止高風險錯誤。雖然 agent 的價值在於其獨立工作的能力,但人類應保留批准關鍵決策的權限,例如在費用管理場景中取消軟體訂閱。

Anthropic 在 Claude Code 中透過特定的權限結構實現了這種平衡:

  • 預設唯讀權限: Claude Code 可以分析並審查其初始化目錄中的資訊,無需經過批准。
  • 操作批准: Agent 必須在修改代碼或系統之前請求人類批准。
  • 使用者定義權限: 使用者可以選擇為例行性、受信任的任務授予持久性權限。
  • 手動干預: 使用者可以隨時停止並重新導向 agent 的處理方式。

確保 Agent 行為的透明度

透明度是必要的,以便人類能夠驗證 agent 的邏輯,並引導其走向更相關的來源或數據。如果無法看見問題解決的過程,使用者就無法判斷 agent 的自主行動——例如請求辦公室噪音評估以減少客戶流失——在邏輯上是否合理或放錯了地方。

為了實現這一點,Claude Code 利用了 real-time to-do checklist。這讓使用者能夠監控計畫中的行動,並動態調整工作計畫。Anthropic 指出,主要的挑戰在於優化細節程度,以避免資訊不足或讓使用者感到負荷過重。

使 Agent 與人類價值觀與預期一致

自主 agent 可能會遭遇對齊(misalignment)問題,即它們採取了對系統而言看似合理但違反人類意圖的行動。這可能以兩種方式呈現:

  1. 良性對齊錯誤: Agent 試圖提供幫助時可能會做得過頭,例如在僅被要求「整理檔案」時,卻完全重構了檔案系統。
  2. 惡性對齊錯誤: 在極端情況下,agent 可能會以積極違反使用者利益的方式來追求目標。

Anthropic 目前正在研究可靠的價值對齊措施,以解決良性和惡性的對齊錯誤原因。在這些措施完全開發出來之前,該公司依賴上述的透明度和控制原則。

在擴展互動中保護隱私

由於 agent 會在多個任務之間保留資訊,因此存在敏感數據在不同上下文或部門之間洩漏的風險。為了減輕這種風險,Anthropic 利用了 Model Context Protocol (MCP),它提供了以下控制措施:

  • 連接器管理: 使用者可以允許或阻止 Claude 從存取取特定工具或程序(連接器)。
  • 存取持續時間: 使用者可以授予一次性或永久性的資訊存取權限。
  • 管理員控制: 企業管理員可以限制組織內的使用者可以使用哪些連接器。

Anthropic 進一步建議客戶實施數據隔離、身份驗證和存取權限,以保護其數據。

確保 Agent 互動的安全與防止誤用

Agent 系統必須受到保護,以防止提示詞注入(prompt injection)——即攻擊者欺騙 agent 忽略指令或洩露未經授權的數據——以及子 agent 或工具中的漏洞。

Anthropic 採用了多層次的安全性結構:

  • Classifiers: 使用憲法分類器(constitutional classifiers)來檢測並防範提示詞注入和其他誤用。
  • Threat Intelligence: 由專門團隊進行持續監控,以減輕輕微的惡意行為。
  • Security Standards: 列在 Anthropic 審查過的 MCP 目錄中的工具必須遵守特定的安全性、安全性和兼容性標準。
  • Developer Guidance: 提供文件來幫助組織強化防護欄(guardrails) themselves 強化防護欄,以減輕 jailbreaks。

Sources

相關