ChatGPT Atlas: 加固浏览器代理以抵御提示注入

OpenAI 为 ChatGPT Atlas 浏览器代理引入了一项安全更新,利用新近对抗训练的模型和加强的防护措施来缓解提示注入攻击。此更新是更广泛的 "rapid response loop" 的一部分,旨在通过自动化红队在外部对手部署之前内部发现新型攻击策略。

浏览器代理中提示注入的挑战

提示注入发生时,恶意指令被嵌入到 AI 代理处理的内容中,覆盖用户的意图并劫持代理的行为。对于 ChatGPT Atlas 浏览器代理而言,这会创建一个重要的威胁向量,因为该代理与实际上无限的不受信任内容表面区域进行交互,包括:

  • 电子邮件及附件
  • 日历邀请
  • 共享文档
  • 论坛和社交媒体帖子
  • 任意网页

由于代理可以执行类似于人类用户的操作——例如发送电子邮件、转账或编辑云文件——成功的注入可能导致未经授权地共享敏感信息或代表用户执行有害操作。

通过强化学习进行自动攻击发现

为了大规模识别漏洞,OpenAI 开发了一个基于 LLM 的自动化攻击者,并使用强化学习 (RL) 进行训练。该系统旨在追踪能够成功危害浏览器代理的提示注入攻击。

由强化学习驱动的红队方法论

自动化攻击者采用多种先进技术以提高其效果:

  • 端到端训练: 攻击者从自身的成功和失败中学习,以提高其红队能力。
  • 反事实模拟: 在发动攻击之前,攻击者会向外部模拟器提出候选注入。模拟器提供受害代理行为的完整推理和行动轨迹,使攻击者能够基于丰富的上下文反馈进行迭代和改进攻击。
  • 不对称优势: 攻击者可以特权访问防御者的内部推理轨迹,而外部用户无法获取,这增加了在对手之前发现漏洞的可能性。

为何选择强化学习

OpenAI 出于三个主要原因选择了强化学习:

  1. 长期目标: 强化学习适用于需要多步推理和与稀疏、延迟奖励信号交互的对抗任务。
  2. 前沿模型能力: 通过将前沿 LLM 训练为自动红队成员,攻击者的能力会随着基础模型在推理和规划方面的提升而自动扩展。
  3. 自适应行为: 强化学习通过迭代尝试策略并从结果中学习,模拟人类攻击者的行为。

与以前的自动化红队不同,此系统能够发现复杂的、长期的有害工作流。例如,该系统发现了一种漏洞:恶意电子邮件可能诱使代理向首席执行官发送辞职信,而用户只是要求代理起草一份外出自动回复。

主动的快速响应循环

OpenAI 正在利用自动化攻击者的发现来驱动一个持续的加固循环:

  • 对抗训练: 更新后的代理模型会持续针对自动红队发现的最成功的攻击进行训练。这将鲁棒性直接“烧入”到模型检查点中。
  • 防御栈迭代: 攻击轨迹被用来改进非模型防护措施,包括系统级控制、监控以及模型上下文内的安全指令。
  • 野外攻击响应: 可以将在野外观察到的外部对手的策略反馈回循环,以模拟活动并推动平台范围的防御变化。

用户安全建议

为了在系统级加固继续进行的同时降低个人风险,OpenAI 建议采用以下做法:

  • 限制已登录访问: 在任务不需要访问已登录账户时,使用“已登出模式”。
  • 审查确认: 在继续之前,仔细核实所有与购买或发送电子邮件等后果性操作相关的确认请求。
  • 提供明确指令: 避免使用宽泛的提示(例如,“采取任何必要的行动”)。使用具体且范围明确的任务会使隐藏的恶意内容更难影响代理。

Sources