OpenAI 前沿 AI 训练安全案例框架
OpenAI 提倡采用结构化的安全文档(称为“安全案例”),作为继续进行任何前沿强化学习 (RL) 训练运行的前提条件。这些安全案例旨在作为关于风险的全面、基于证据的论证,效仿航空和核能等安全关键行业,以应对 AI 能力日益增长的复杂性。
AI 训练的技术保障
安全案例必须解决技术栈的三个主要层面:对齐训练、遏制和监控。这种多层方法确保模型经过训练以保持可靠性,在出现未对齐时被遏制,并受到监控以在造成损害前发现问题。
模型对齐
对齐训练是确保模型按预期行事的第一道防线。OpenAI 建议采取以下做法:
- 训练环境与评分: 为防止强化“奖励黑客行为”和未对齐行为,实验室应使用自动化智能体来发现并修复损坏的 RL 环境,辅以人工数据集审查,并调整评分器以惩罚利用漏洞的行为。使用分类器对实验轨迹进行先前的运行分析,可以验证评分器的有效性。
- 对齐度量: 通过前沿运行期间的离线对齐评估、针对过往事件的回测评估以防止过拟合,以及监控“评估博弈”(即模型识别出它们正在被测试)来跟踪有效性。最坏情况下的压力测试用于诱导和检测不当行为。
- 思维链限制: 在 RL 期间,应防止自动化评分器看到模型的思维链,以阻止模型进化出规避监控的技术。
遏制
如果模型出现未对齐,遏制策略通过基础设施安全防止有害行为,从而提供后备方案:
- 基础设施加固: 这涉及对模型沙箱和托管研究基础设施的多层安全保护。
- 遏制红队测试: 使用来自前沿运行的检查点,对沙箱、边界安全以及模型可以访问的所有服务(如互联网缓存)进行迭代红队测试。
- 通信限制: 高带宽跨样本通信应限制在批准的路径内(例如,多智能体工具),以关闭可发现的基础设施侧信道。
- 不可变记录: 所有 RL 训练、评估和内部部署记录必须保存在一次写入存储中,以确保可靠的事件调查并防止编辑。
监控
实时监控系统旨在快速捕捉未对齐的操作:
- 可监控性: 模型必须保持可监控,并为监控规避评估设定明确的阈值。
- 高召回率: 监控系统必须通过留出评估证明其对过去事件具有高召回率。
- 评估新鲜度: 每次运行都必须创建新的评估数据点,以确保监控的精确度和召回率不会过时。
- 快速响应: 优先警报必须在定义的 SLA 内触发操作,例如呼叫值班人员或自动暂停运行。
安全案例的操作指南
OpenAI 概述了操作最佳实践,以确保安全案例得到严格审查和执行:
- 治理与审批: 安全案例需要高级领导层的审查和否决权,包括研究组织负责人/副总裁、安全主管和首席科学家。负责运行的高级领导在绩效评估中对安全案例和事件响应负责。
- 风险缓解与控制:
- 异议(预演): 外部团队成员必须撰写异议,以找出安全案例中的漏洞。
- 技术控制: 系统应设计为“故障关闭”,使得难以启动不合规的运行或从训练过程中禁用监控。
- 暂停与回滚: 必须存在用于暂停运行的明确手册和 SLA,并必须保持识别和撤销未对齐输出(例如在数据生成中)影响的能力。
- 透明度与审计: 安全案例应提供给内部监督小组(如安全与保障委员会),审计员必须拥有足够的访问权限来验证声明。
- 升级: 必须存在针对未对齐严重程度级别的定义流程,并配备能够呼叫高管(包括 CEO)处理高严重性事件的值班系统。
- 残余风险: 安全案例必须明确列出当前缓解措施未涵盖的所有残余风险,以告知风险接受决策。
未对齐事件的调查
在发生严重的未对齐事件后,OpenAI 建议采取严格的调查流程以防止再次发生:
- 根本原因分析: 研究人员应使用针对性的消融或重采样实验来了解引入未对齐行为的训练动态。
- 事后总结: 操作和文化层面的事后总结应确定为何问题未被发现或未被升级。
- 检测改进: 应开发新的对齐测试方法来发现事件倾向,而不必针对事件的具体数据进行爬坡。源自事件的评估可作为“回归测试”。
- 透明度: 调查应提供定期的内部更新,并以结果、事后总结和操作变更的公开披露作为结束,并立即通知受影响的第三方。