OpenAI 准备框架更新

OpenAI 已更新其准备框架,这是一套用于跟踪和准备可能带来严重危害风险的高级 AI 能力的结构化流程。本次更新侧重于 sharpen 风险优先级、加强风险最小化要求,并为评估与治理安全措施提供更明确的操作指引。

风险优先级和标准

OpenAI 使用结构化的风险评估流程,将能力按是否可能导致严重危害进行分类。如果一种能力满足以下五个具体标准——可行、可衡量、严重、全新,并且是瞬时或不可补救的——则会被优先进行前期准备。

能力类别

该框架将 AI 能力划分为两大主要类别,以管理双重用途风险和新兴威胁:

已跟踪类别

这些是已有成熟评估和持续安全措施的既定领域。包括:

  • 生物和化学能力
  • 网络安全能力
  • AI 自我改进能力

研究类别

这些领域被认定可能带来严重危害风险,但尚未满足成为已跟踪类别的标准。OpenAI 正在为这些领域开发威胁模型和高级评估,涵盖:

  • 长程自主性
  • 设陷(故意表现不佳)
  • 自主复制与适应
  • 破坏安全措施
  • 核与放射性

说服风险在本框架之外通过模型规范、对政治竞选和游说的限制以及对影响行动的调查进行管理。

能力层级与运营承诺

OpenAI 将能力层级简化为两个阈值,以触发特定的运营要求:

  • 高能力:可能放大已有导致严重危害路径的能力。达到此层级的系统必须在部署前拥有能够“足够降低”相关风险的安全措施。
  • 关键能力:可能开辟前所未有的新路径导致严重危害的能力。这类系统在开发和部署期间都需要拥有足以降低相关风险的安全措施。

安全咨询组(SAG)是由内部安全领袖组成的跨职能团队,负责审查这些安全措施并向 OpenAI 领导层提供最终部署决策的建议。SAG 的指导范围从批准部署到要求进一步的防护或评估。

评估规模化与报告

为跟上更快的模型改进周期——这些周期往往由推理进步而非大规模训练驱动——OpenAI 实施了一套自动化评估,以实现测试规模化。这些评估由专家主导的“深度审查”补充,以确保准确性。

报告也被细分为两种不同的文档类型:

  • 能力报告:评估模型是否已跨越风险阈值。
  • 安全措施报告:提供关于安全措施设计与验证的详细信息,遵循“纵深防御”原则。

对前沿格局的响应

OpenAI 表示,如果其他前沿 AI 开发者在缺乏相当安全措施的情况下发布高风险系统,OpenAI 可能会调整自身要求。此类调整仅在严格确认风险格局已改变、公开承认该调整并评估该变更不会显著提升整体严重危害风险且仍保持保护性安全水平后才会进行。

Sources