OpenAI 安全漏洞赏金计划启动

OpenAI 已启动公开的安全漏洞赏金计划,以识别并缓解其产品中的 AI 滥用和安全风险。该计划旨在补充现有的安全漏洞赏金计划,通过奖励发现具有重要安全风险的问题的研究人员,即使这些问题不符合传统安全漏洞的定义。

代理风险与 MCP

OpenAI 正在优先识别与代理式 AI 产品相关的风险,包括模型上下文协议(Model Context Protocol,MCP)。该计划接受以下代理漏洞的报告:

  • 第三方提示注入和数据泄露:报告必须证明攻击者的文本能够可靠地劫持受害者的代理(例如 ChatGPT Agent 或 Browser),执行有害操作或泄露敏感用户信息。这些行为必须至少在 50% 的情况下可复现。
  • 大规模未授权操作:指代理式 OpenAI 产品在 OpenAI 自己的网站上大规模执行不允许的操作的情况。
  • 通用有害行为:任何导致合理且实际伤害的代理行为,即使未在其他类别中明确列出。

研究人员在测试 MCP 风险时必须遵守第三方服务条款。

OpenAI 专有信息

该计划针对 OpenAI 内部数据的泄露。范围内的问题包括:

  • 与推理相关的专有信息:模型生成返回关于模型推理过程的专有信息。
  • 通用专有泄露:暴露其他 OpenAI 专有信息的漏洞。

账户与平台完整性

该计划侧重于维护系统访问控制和信任信号的完整性:

  • 完整性信号绕过:允许用户绕过反自动化控制、操纵账户信任信号或规避账户限制、暂停或封禁的漏洞。
  • 基于权限的问题:允许未授权访问功能、数据或功能的漏洞将转交至安全漏洞赏金计划。

范围限制与排除

OpenAI 指明,一般的 jailbreak(越狱)和内容政策绕过不在本计划范围内。具体而言,导致模型使用粗鲁语言或返回通过搜索引擎轻易获取的信息的“越狱”不符合奖励条件。

然而,OpenAI 可能会根据具体情况对那些能够直接导致用户伤害且具备可操作修复步骤的缺陷予以奖励。此外,实验室会定期开展针对特定危害类型的私密活动,例如 ChatGPT Agent 和 GPT-5 中的生物风险内容问题。

参与流程

研究人员可通过 Bugcrowd 平台申请参与本计划。提交的报告由 OpenAI 的安全与安全漏洞赏金团队进行分流,依据问题的范围和归属,报告可能在两个计划之间转交。

Sources