Anthropic 可信智能体框架与实现
Anthropic 推出了开发可信 AI 智能体的一套全面方法,实现了从简单的聊天机器人向能够执行代码、管理文件并在多个应用程序之间进行交互的自主系统的转变。这种转变提高了生产力,但也引入了关键风险,特别是智能体误解用户意图的可能性以及容易受到提示词注入(prompt injection)网络攻击的风险。
AI 智能体的架构
AI 智能体被定义为一种能够通过指导自身的流程和工具使用来完成任务的模型,它在一个包含规划、行动、观察和调整的自我导向循环中运行。Anthropic 确定了决定智能体能力和安全概况的四个关键组成部分:
- 模型 (The Model): 源自训练过程的核心智能,决定了推理和行为。
- 控制框架 (The Harness): 模型运行所遵循的一套指令和护栏(例如,一条“绝不提交未经确认的费用报销”的规则)。
- 工具 (Tools): 模型可以访问的外部服务和应用程序,例如电子邮件、日历或专业软件。
- 环境 (The Environment): 智能体运行的具体设置(例如,公司笔记本电脑与个人手机),这决定了数据访问权限以及智能体行为的风险程度。 \nAnthropic 强调,安全性不能仅依赖于模型;一个训练良好的模型仍可能因配置不当的控制框架、权限过大的工具或暴露的环境而受到威胁。
实现可信原则
Anthropic 将五个核心原则——人类控制、符合人类价值观、保障交互安全、透明度和隐私——应用于其产品设计中。
为人类控制而设计
为了在自主性与安全性之间取得平衡,Anthropic 实施了分层监督机制:
- 细粒度权限 (Granular Permissions): 在 Claude.ai 和 Claude Desktop 中,用户可以为特定工具设置权限(例如,“始终允许”、“需要批准”或“阻止”)。
- 计划模式 (Plan Mode): 在 Claude Code 中引入的这一功能允许用户在执行前审查并编辑智能体的整个预期行动计划,从而将监督重点从单个步骤转向整体策略。
- 子智能体协作 (Subagent Coordination): 随着智能体开始将任务委派给并行的子智能体,Anthropic 正在研究协作模式,以确保这些复杂的流程保持可控且透明。
使智能体目标与用户意图对齐
智能体开发中的一个主要挑战是校准智能体何时应该自主行动,以及何时应该暂停并寻求澄清。Anthropic 通过以下方式解决此问题:
- 场景训练 (Scenario Training): 创建训练场景,奖励模型在模糊的情况下暂停而非做出假设的行为。
- 宪法 AI (Constitutional AI): 利用 Claude 的 Constitution 来强化在继续操作前提出疑虑或寻求澄清的本能。
研究表明,在处理复杂任务时,Claude 向用户确认的频率大约翻了一倍,证明了这种校准的有效性。
防御提示词注入
提示词注入发生在恶意指令被隐藏在智能体处理的数据中时,可能会诱导模型执行未经授权的操作。Anthropic 采用了多层防御策略:
- 模型训练 (Model Training): 训练模型识别并忽略注入模式。
- 流量监控 (Traffic Monitoring): 监控生产环境流量以拦截现实世界的攻击。
- 红队测试 (Red-Teaming): 使用外部专家进行实战测试。
由于没有任何单一的防御措施是绝对的,Anthropic 建议用户根据环境的风险概况,限制授予智能体的工具、数据和权限。
智能体安全性的全生态系统要求
Anthropic 认为,智能体的可靠性无法由单一公司实现,需要共享的行业基础设施:
- 标准化基准 (Standardized Benchmarks): 与 NIST 等机构合作,创建用于提示词注入抵御能力和不确定性显现的独立验证基准。
- 证据共享 (Evidence Sharing): 通过发布关于智能体在哪些方面存在困难的数据,为政策制定者提供更清晰的现实世界使用情况的图景。
- 开放标准 (Open Standards): 创建并随后将 Model Context Protocol (MCP) 捐赠给 Linux Foundation 的 Agentic AI Foundation。这确保了安全属性被内置于基础设施中,而不是在每次部署时进行修补,并使竞争集中在智能体质量而非集成控制权上。
Sources
- OriginalTrustworthy agents in practice
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch