Anthropic 浏览器使用场景下的提示词注入防御措施

Anthropic 增强了 Claude Opus 4.5 和 Claude for Chrome 扩展程序的鲁棒性,以抵御提示词注入——即隐藏在网页内容中旨在劫持 AI 智能体的对抗性指令。

虽然这些更新显著降低了攻击成功率,但 Anthropic 指出,对于任何执行真实世界浏览器操作的智能体而言,提示词注入仍然是一个活跃的安全挑战。

浏览器智能体中提示词注入的本质

当 AI 智能体处理包含隐藏恶意指令的不可信内容(如网页、文档或电子邮件)时,就会发生提示词注入。这些指令可以覆盖用户的原始意图,并强制智能体执行未经授权的操作。

基于浏览器的智能体面临独特的风险,因为攻击面非常广泛,涵盖了每一个网页、广告和动态加载的脚本。此外,潜在的危害性也随之增加,因为浏览器智能体可以执行高影响力的操作,包括:

  • 导航到特定 URL
  • 填写表单
  • 点击按钮
  • 下载文件

例如,攻击者可以在电子邮件中嵌入不可见文本,指示浏览器智能体在执行诸如起草会议回复之类的常规任务时,将机密通信转发到外部地址。

Claude 鲁棒性的技术改进

Anthropic 实施了多层防御策略,以降低提示词注入的攻击成功率 (ASR)。这些改进为 Claude for Chrome 扩展程序从研究预览版向 Max 计划用户的 Beta 版过渡提供了依据。

用于抵抗力的强化学习

Anthropic 使用强化学习将鲁棒性直接构建到模型的核心能力中。在训练期间,Claude 会接触到嵌入在模拟网页内容中的提示词注入。当模型正确识别并拒绝执行恶意指令(即使是那些旨在表现得紧迫或权威的指令)时,它会获得“奖励”。

增强型分类器

所有进入模型上下文窗口的不可信内容都会经过分类器的扫描。这些系统旨在检测以各种形式隐藏的对抗性命令,例如:

  • 隐藏文本
  • 被操纵的图像
  • 欺骗性的 UI 元素

当检测到攻击时,分类器会触发干预措施,引导模型的行为,以防止智能体遵循恶意指令。

专家级人工红队测试

为了发现自动化系统可能遗漏的创造性攻击向量,Anthropic 雇佣了内部安全研究人员进行持续探测。此外,该公司还参加了外部 Arena 风格的挑战赛,以衡量其鲁棒性与行业标准的基准。

当前性能与局限性

根据使用自适应“Best-of-N”攻击者(每个环境给定 100 次尝试)的内部测试,与之前的配置相比,Claude Opus 4.5 和更新后的防护措施显示出攻击成功率的显著降低。

然而,Anthropic 强调,没有任何浏览器智能体能完全免疫提示词注入。即使是 1% 的攻击成功率也代表着实质性的风险,公司认为该问题尚未得到完全解决。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch