OpenAI 提示注入安全概览

OpenAI 提示注入安全概览 OpenAI 概述了提示注入攻击的性质以及多层防御策略,以在 AI 代理获得更多自主权和数据访问时保护用户。

OpenAI 提示注入安全概览

提示注入是一种针对对话式 AI 的社会工程攻击

提示注入发生在第三方(既不是用户也不是 AI)将恶意指令插入对话上下文以误导模型时。这通常发生在 AI 访问外部内容时,例如网页、文档或电子邮件,这些内容可能包含旨在诱使 AI 执行非预期操作的隐藏指令。 随着 AI 工具从简单的问答系统过渡到能够浏览网页、规划行程和访问应用数据的代理,这些攻击的风险增加。潜在结果包括:

  • 次优推荐: 攻击者可能在列表中隐藏指令,迫使 AI 推荐特定房产,而不管用户偏好。
  • 数据泄露: 攻击者可能发送包含错误信息的电子邮件,诱使 AI 代理查找并共享用户的银行对账单。

OpenAI 的多层防御策略

OpenAI 采用多种重叠的技术和程序防护措施来降低提示注入风险并提高模型鲁棒性。

安全培训与研究

OpenAI 使用安全训练来帮助模型识别并忽略提示注入模式。这包括开发 指令层次结构,旨在帮助模型区分可信和不可信指令的研究。公司还利用自动红队演练来发现和开发新型攻击向量,以进行主动缓解。

自动监控

AI 驱动的监控器被部署以实时识别和阻止提示注入攻击。这些监控器通过允许快速更新以阻止新的攻击模式来补充安全训练,并帮助 OpenAI 在攻击广泛部署之前检测对抗性研究和测试。

基础设施和安全防护

实施产品特定的安全措施以保护用户数据:

  • 链接批准: ChatGPT 可能要求用户在访问某些链接之前先批准,特别是在已请求不被收录的网站上。
  • 沙箱: 对于运行代码或程序的工具(如 Codex 或 Canvas),会使用沙箱来防止模型因注入而做出有害更改。

用户控制与透明度

OpenAI 集成了使用户能够自行管理风险的控制功能:

  • 登出模式: 在 ChatGPT Atlas 中,用户可以选择在未登录网站的情况下启动任务。
  • 确认提示: 代理在执行敏感操作(如完成购买)之前会暂停并要求确认。
  • 观察模式: 对于敏感网站,此模式会提醒用户并要求浏览器标签保持活跃;如果用户离开,代理将暂停。
  • 教育: OpenAI 提供有关访问哪些数据以及连接 ChatGPT 到其他应用时相关风险的解释。

外部验证

OpenAI 利用内部和外部红队演练(专注于提示注入的数千小时)以及漏洞赏金计划,以奖励展示导致非预期数据泄露的现实攻击路径的独立安全研究人员。

AI 代理安全的用户最佳实践

为了降低提示注入的风险,OpenAI 建议采取以下行为防护措施:

  • 限制数据访问: 使用类似“登出”模式的功能,将代理的访问限制为仅执行任务所需的必要凭据或敏感数据。
  • 验证后果操作: 在允许代理发送电子邮件或完成购买之前,仔细审查确认提示。
  • 主动监控: 当代理在敏感网站(例如银行)上运行时,用户应主动观察代理的工作。
  • 提供明确指令: 避免使用诸如“查看我的电子邮件并采取必要行动”之类的宽泛命令。而是提供具体、狭窄的指令,以使恶意内容更难误导模型。

AI 安全的未来展望

OpenAI 将提示注入描述为一个前沿研究问题,需要持续演进风险缓解策略。尽管尚未观察到攻击者大规模采用这些技术,但 OpenAI 正在投资研究以提高 AI 鲁棒性,并计划发布一份即将发布的报告,以检测 AI 与互联网通信时何时传输对话信息。

Sources