OpenAI 设计 AI 代理以抵御提示注入
OpenAI 将提示注入防御转向社会工程模型
OpenAI 宣布了一种新的方法来保护 AI 代理免受提示注入的威胁,摆脱对输入过滤和“AI 防火墙”的依赖,转而采用将提示注入视为一种社会工程的系统。这一转变是必要的,因为现代攻击已从简单的提示覆盖演变为类似社会工程的复杂操纵,使得传统分类系统越来越难以检测。
提示注入攻击的演变
当外部内容中的指令试图操纵 AI 代理执行用户未请求的操作时,就会发生提示注入。OpenAI 观察到,早期的攻击相对简单——例如在维基百科页面添加直接指令——而现代模型对这些基本覆盖的抵抗力已增强。
因此,攻击技术已演变为包含社会工程手段。由于这些攻击现在类似于错误信息或谎言,往往无法被“AI 防火墙”或旨在将输入分类为恶意或正常的中间系统捕获。
应用社会工程风险管理框架
为应对这些不断演变的威胁,OpenAI 通过人类代理在对抗环境中使用的风险管理视角来审视 AI 代理的安全。目标是限制成功操纵的影响,而不是试图完美识别每一个恶意输入。
OpenAI 将 AI 代理比作人类客服代表。在这样的系统中,代理必须代表雇主行事,同时会接触到可能误导他们的外部输入。为降低风险,组织实施确定性系统和规则以限制代理的能力,例如:
- 能力限制: 限制代理可发放的退款或礼品卡的金额。
- 确定性缓解措施: 使用能够标记网络钓鱼邮件或对操作设定硬性上限的系统,以防止单个被攻陷的代理造成重大损害。
ChatGPT 中的安全实现
OpenAI 将此社会工程框架与传统安全工程相结合,特别是源-汇分析。在此情境中,源是影响系统的方式(不可信的外部内容),而汇是若在错误情境下会变得危险的能力(例如,将信息传输给第三方)。
为防止危险行为或敏感信息的静默传输,OpenAI 在 ChatGPT 中实现了以下防御措施:
- 安全训练: 主要防御是安全训练,使代理在大多数情况下拒绝恶意请求。
- 安全 URL: 一种缓解策略,用于检测对话中获取的信息即将被传输给第三方的情况。如果检测到,系统要么阻止传输并指示代理寻找其他路径,要么将信息呈现给用户以获取明确确认。
AI 代理集成的建议
对于将 AI 模型集成到应用系统的开发者,OpenAI 建议实施类似于人类代理在相同角色中拥有的控制措施。虽然 OpenAI 预计高度智能的模型最终会比人类更能抵御社会工程攻击,但实施结构性控制仍是最具成本效益且可行的安全方法。