Anthropic 安全且值得信赖的 AI Agent 框架

Anthropic 发布了一个用于开发安全且值得信赖的 AI agent 的早期框架。该框架建立了一套指导原则,旨在确保随着 AI 从被动助手转变为能够独立追求复杂目标的自主 agent,它们仍能与人类价值观保持一致,并处于人类的监督之下。

平衡 Agent 的自主性与人类控制

即使 agent 在自主运行,也必须保持人类监督,以防止高风险错误。虽然 agent 的价值在于其独立工作的能力,但人类应保留批准关键决策的权限,例如在费用管理场景中取消软件订阅。

Anthropic 在 Claude Code 中通过特定的权限结构实现了这种平衡:

  • 默认只读权限: Claude Code 可以分析和审查其初始化目录中的信息,而无需批准。
  • 操作批准: agent 必须在修改代码或系统之前请求人类批准。
  • 用户定义权限: 用户可以选择为常规、可信的任务授予持久权限。
  • 手动干预: 用户可以随时停止并重定向 agent 的方法。

确保 Agent 行为的透明度

透明度是必要的,以便人类能够验证 agent 的逻辑,并引导其转向更相关的来源或数据。如果无法洞察问题解决的过程,用户就无法确定 agent 的自主行为——例如请求办公室噪音评估以减少客户流失——在逻辑上是否合理或是否错位。

为了实现这一点,Claude Code 利用了 实时待办事项清单 (real-time to-do checklist)。这允许用户监控计划中的操作并动态调整工作计划。Anthropic 指出,主要的挑战在于优化细节程度,以避免信息不足或让用户感到负担过重。

使 Agent 与人类价值观和预期保持一致

自主 agent 可能会遭遇对齐(misalignment)问题,即它们采取了对系统而言看似合理但违反人类意图的行为。这可能表现为两种方式:

  1. 良性对齐偏差 (Benign Misalignment): 一个试图提供帮助的 agent 可能会过度扩张,例如在仅被要求“整理文件”时,完全重构了文件系统。
  2. 恶性对齐偏差 (Malign Misalignment): 在极端情况下,agent 可能会以主动违背用户利益的方式追求目标。

Anthropic 目前正在研究可靠的价值对齐措施,以解决良性和恶性的对齐偏差原因。在这些措施完全开发出来之前,公司依靠上述的透明度和控制原则。

在扩展交互中保护隐私

由于 agent 会在多个任务中保留信息,因此存在敏感数据在不同上下文或部门之间泄露的风险。为了缓解这一风险,Anthropic 利用了 Model Context Protocol (MCP),它提供了以下控制:

  • 连接器管理 (Connector Management): 用户可以允许或阻止 Claude 从访问特定的工具或流程(连接器)。
  • 访问时长: 用户可以授予一次性或永久的信息访问权限。
  • 管理控制: 企业管理员可以限制组织内用户可用的连接器。

Anthropic 进一步建议客户实施数据隔离、身份验证和访问权限管理,以保护其数据。

确保 Agent 交互的安全并防止滥用

Agent 系统必须防止提示词注入 (prompt injection)——即攻击者诱导 agent 忽略指令或泄露未经授权的数据——以及子 agent 或工具中的漏洞。

Anthropic 采用了一种多层安全方法:

  • 分类器 (Classifiers): 使用宪法分类器 (constitutional classifiers) 来检测并防御提示词注入和其他滥用行为。
  • 威胁情报 (Threat Intelligence): 由专门团队进行持续监控,以缓解新兴的恶意行为。
  • 安全标准: 列在 Anthropic 审查过的 MCP 目录中的工具必须遵守特定的安全、安全性和兼容性标准。
  • 开发者指南: 提供文档以帮助组织加强护栏 (guardrails) 允许组织加强护栏并缓解越狱 (jailbreaks)。

Sources

相关