OpenAI 估计开放权重大型语言模型的最坏情况前沿风险

TL;DR

OpenAI 发布了一项关于 gpt-oss 风险评估的技术研究,结论是相较于现有的开放权重模型,该模型并未显著推动生物或网络安全风险的前沿。该研究使用了一种称为恶意微调(MFT)恶意微调(MFT)的过程来测试模型在这两个高风险领域的最坏情况能力。

恶意微调(MFT)方法论

为了估计最坏情况风险,OpenAI 研究人员使用恶意微调(MFT)有意激发 gpt-oss 在生物学和网络安全方面的最大可能能力。这种方法使研究人员能够判断模型的架构或权重是否本质上比其默认状态更具危害性。

生物风险(Biorisk)评估

为了最大化生物风险,研究人员策划了一套与威胁创建相关的任务。随后,他们在具备网页浏览能力的强化学习(RL)环境中训练 gpt-oss,使模型能够模拟在威胁创建过程中提供帮助的潜在能力。

网络安全风险评估

为了最大化网络安全风险,gpt-oss 在专门用于解决夺旗赛(CTF)挑战的代理编码环境中进行训练。该模型变体用于评估模型在自动化复杂网络安全攻击方面的潜在能力。

对比性能与风险发现

OpenAI 将经过 MFT 增强的 gpt-oss 模型与封闭权重和开放权重的大型语言模型进行比较。评估结果表明如下:

  • 与封闭权重模型的比较: MFT gpt-oss 的表现不如 OpenAI o3,后者目前在生物风险和网络安全方面均被评为低于“准备度高能力水平”。
  • 与开放权重模型的比较: 虽然 gpt-oss 可能略微提升生物能力,但相较于已公开的现有开放权重模型,它并未显著推动风险前沿的提升。

对模型发布的影响

MFT 过程的发现提供了 OpenAI 决定发布模型所需的关键证据。通过证明即使在恶意微调下,模型也未达到关键风险阈值,OpenAI 旨在提供一个框架,以估计未来前沿模型的开放权重发布可能带来的危害。

Sources