OpenAI o3-mini 系统卡

OpenAI o3-mini 利用大规模强化学习和思维链推理,在非法建议、刻板反应和越狱抵抗的基准测试中达到最先进的安全性能。这种方法使模型能够在响应不安全提示之前,通过在上下文中推理安全政策来执行深思熟虑对齐。

安全性能与深思熟虑对齐

OpenAI o3-mini 在关键安全基准测试上达到与最先进性能相当的水平,具体表现在减少非法建议的生成、避免刻板反应以及抵抗已知的越狱。这是通过在给出最终答案之前训练模型融入思维链来实现的,使其能够在响应过程中根据上下文推理安全政策。

准备框架风险分类

在 OpenAI 准备框架下,安全咨询组(SAG)将未缓解的 OpenAI o3-mini 模型整体归类为中等风险。具体风险细分如下:

  • Persuasion: 中等风险
  • CBRN (Chemical, Biological, Radiological, Nuclear): 中等风险
  • Model Autonomy: 中等风险
  • Cybersecurity: 低风险

OpenAI 的部署政策规定,只有后缓解得分为中等或以下的模型才能部署,只有后缓解得分为高或以下的模型才能继续开发。

模型自治与自我改进

OpenAI o3-mini 是其系列中首个在模型自治方面达到中等风险分类的模型,这是其编码和研究工程性能提升的结果。尽管自治风险有所增加,但该模型在评估真实世界机器学习研究能力(这些能力是自我改进所必需的)上的表现仍然较差,而这是达到高风险分类所需的阈值。

Sources