OpenAI 前沿 AI 安全外部测试框架

OpenAI 利用独立的第三方评估来验证安全声明、识别盲点,并提高对前沿 AI 模型能力和风险的透明度。这些外部评估提供了一层独立的严谨性,可以防止自我确认,并为负责任的部署决策提供信息。

三种主要的外部评估形式

OpenAI 与外部合作伙伴采用三种不同的合作模式来评估其模型:

1. 独立评估

独立实验室使用自己的方法进行开放式测试,以生成关于特定前沿能力的声明或评估。

  • 在 GPT-5 中的应用: OpenAI 协调了针对 GPT-5 的外部评估,重点关注长期自主性、谋划、欺骗、监督绕过、进攻性网络安全以及湿实验室规划的可行性。
  • 访问级别: 为了促进这些测试,OpenAI 提供对早期模型检查点的安全访问、零数据保留选项以及减少缓解措施的模型(例如,“仅有帮助”模型)。
  • 推理透明度: 一些组织获得了直接的思维链访问权限,以检查推理痕迹,这使得评估者能够识别诸如沙袋行为或谋划之类的行为,这些行为在最终输出中否则是不可见的。

2. 方法论审查

当重复评估所需的基础设施或技术专业知识在主要 AI 实验室之外并不常见时,会使用方法论审查。在这些情况下,外部评估者会审查实验室的内部框架和证据,以提出建议。

  • 在 gpt-oss 中的应用: 对于 gpt-oss 开放权重模型,OpenAI 使用对抗性微调来估算生物和网络领域的最坏情况风险。外部评估者审查了内部方法和结果,提供了反馈,导致最终对抗性微调过程发生了变化。
  • 结果: 这些评审的结果(包括哪些建议被采纳以及哪些未被采纳的理由)记录在模型的系统卡和相关研究论文中。

3. 主题专家(SME)探测

SME 探测涉及专家在真实世界任务中直接评估模型,以通过调查提供结构化输入。这与红队测试不同,因为它侧重于评估能力,而不是对特定防护措施进行压力测试。

  • 在 ChatGPT Agent 和 GPT-5 中的应用: 专家使用仅有帮助的模型来测试端到端的生物场景。他们对模型的“新手提升”进行评分——即模型能够将有动力的新手推向熟练执行的程度,相较于专家自身的能力。
  • 整合: 此专家判断用于补充准备框架评估,以提供静态评估可能遗漏的真实世界背景。

第三方合作的原则

OpenAI 根据三个核心原则构建其外部合作伙伴关系,以在透明度与安全之间取得平衡:

  • 保密性与出版: 评估者签署保密协议(NDA)以访问非公开信息。OpenAI 在发布前会审查出版物的保密性和事实准确性。已发表的外部工作示例包括 METR 关于 GPT-5 的报告和 Apollo Research 关于 OpenAI o1 的报告。
  • 安全访问: 对于敏感模型(例如,没有安全缓解措施的模型)的访问仅在解决关键安全问题时才会授予,并受到严格且不断演变的安全控制的管理。
  • 财务可持续性: OpenAI 向所有第三方评估者提供补偿——通过直接付款或 API 积分——以确保生态系统的可持续性。补偿永不取决于评估的结果。

更广泛的安全生态系统

外部测试是更大安全策略的一个组成部分。OpenAI 还与美国 CAISI 和英国 AISI 合作,参与集体对齐项目,并利用诸如全球医生网络和 AI 福祉专家委员会之类的咨询小组来指导心理健康和用户福祉方面的工作。

Sources