GPT-Red:解锁自我改进以提升鲁棒性

GPT-Red:解锁自我改进以提升鲁棒性

OpenAI 开发了 GPT-Red,这是一个自动化的红队模型,旨在扩大漏洞发现的规模并提升模型鲁棒性。通过使用 GPT-Red 对生产模型进行对抗训练,OpenAI 在其最新版本中显著降低了对提示注入的易感性,具体来说是 GPT-5.6 Sol。

通过 GPT-Red 进行自动化红队

GPT-Red 是一个仅内部使用的模型,经过训练以充当复杂的攻击者。它通过发送提示、观察模型响应并迭代其方法来实现特定的恶意目标。OpenAI 使用与其一些最大的后训练运算相当的计算规模来训练 GPT-Red,这标志着对专门用于安全的计算资源进行了重大投资。

自我对抗强化学习

GPT-Red 使用自我对抗强化学习框架进行训练。在此设置中,GPT-Red 和一组多样化的“防御者”LLM 在各种红队场景中同时进行训练:

  • 奖励: 当 GPT-Red 成功引发失败时(例如成功的提示注入),它会获得奖励。相反,防御模型在抵御攻击并完成其原始任务时会获得奖励。
  • 共同进化: 随着防御模型变得更加鲁棒,GPT-Red 被迫发现越来越强大且多样化的攻击向量。
  • 环境模拟: 训练在真实场景中进行,在这些场景中,提示注入可以被插入到本地文件、网页横幅、电子邮件正文或工具输出中。

对模型鲁棒性的影响:GPT-5.6 Sol

OpenAI 将 GPT-Red 直接纳入生产模型的训练过程。这种对抗训练使得 GPT-5.6 Sol 在鲁棒性方面获得了显著提升,它是目前最能抵御提示注入的模型。

关键鲁棒性基准

  • 提示注入减少: 与四个月前的最佳生产模型相比,GPT-5.6 Sol 在最困难的直接提示注入基准上的失败次数减少了 6 倍。
  • 直接注入成功率: 在广泛的鲁棒性环境中,GPT-5.6 Sol 仅在 GPT-Red 的直接提示注入中失败 0.05%。
  • 特定攻击类别: GPT-Red 的早期版本发现了“假思维链”攻击,该攻击对 GPT-5.1 的成功率为 95%,但对 GPT-5.6 Sol 已降低至低于 10%。
  • 基准饱和: 最新模型已经使若干针对浏览和开发者工具的间接提示注入基准饱和,准确率超过 97%。

泛化能力和实际效果

为了评估 GPT-Red 是否是通用的红队代理,OpenAI 在其训练过程中未见过的新环境和目标模型上测试了其效果。

与人类红队成员的比较

在 Dziemian 等人(2025)的间接提示注入竞技场的复制版本中,GPT-Red 与人类红队成员对抗以攻击 GPT-5.1。GPT-Red 的攻击成功率达到 84%,显著高于人类仅 13% 的成功率。

实际案例研究

  • AI 售货机(Vendy): GPT-Red 成功攻击了管理售货机的实时自主代理。通过先在模拟中迭代,然后将攻击转移到实时代理,GPT-Red 实现了三个恶意目标:将昂贵商品的价格改为 0.50 美元,订购新的昂贵商品并以 0.50 美元提供,以及取消其他客户的订单。
  • Codex CLI 代理: 在 10 种数据外泄场景的一套测试中,与受提示的 GPT-5.5 基线相比,GPT-Red 在迫使基于 GPT-5.4 mini 的 Codex CLI 代理外泄敏感数据方面更有效且更节省 token。

能力维持

OpenAI 报告称,鲁棒性的提升并未以牺牲通用能力或增加过度拒绝为代价。对通用前沿能力和有针对性的过度拒绝任务的评估表明,正常能力未受影响,这表明鲁棒性的提升源于对恶意指令的更好抵抗,而不是对合法请求的默认拒绝。

Sources