OpenAI gpt-oss-120b 与 gpt-oss-20b 发布

OpenAI 已发布 gpt-oss-120b 和 gpt-oss-20b,这两款开源权重推理模型专为代理工作流而设计。这些模型在 Apache 2.0 许可证和 gpt-oss 使用政策下提供,为开源社区提供了在强指令遵循、工具使用以及可定制推理力度方面的工具。

模型能力与集成

gpt-oss 模型是仅文本推理模型,支持结构化输出并提供完整的思考链(CoT)可视化。它们旨在集成到代理工作流中,特别支持诸如 Python 代码执行和网页搜索等工具使用。

关键技术特性包括:

  • 可定制性:模型可以根据具体需求进行定制。
  • 指令遵循:在遵循复杂指令方面具备强大能力。
  • 推理力度:用户可以为不需要复杂推理的任务调整推理力度。
  • API 兼容性:模型兼容 OpenAI Responses API。

安全性与风险评估

由于开源权重模型可能被第三方微调以绕过安全拒绝,OpenAI 将其视为具有不同风险特征的模型,与专有模型不同。OpenAI 指出,使用这些模型的开发者和企业需要自行实现系统级保护,以复制 OpenAI 专有 API 产品中的保护措施。

为评估这些模型的风险,OpenAI 使用其准备度框架对 gpt-oss-120b 进行可扩展能力评估。评估聚焦于三个跟踪类别:生物与化学能力、网络能力以及 AI 自我改进。结果确认默认模型在这些类别中均未达到“高能力”阈值。

对抗性测试与开源模型前沿

OpenAI 进行对抗性微调模拟,以确定攻击者是否能够将 gpt-oss-120b 修改至在生物与化学或网络领域达到高能力。

根据研究结果:

  • 对抗性微调:即使使用 OpenAI 的训练堆栈进行强健微调,gpt-oss-120b 在生物与化学风险或网络风险方面仍未达到高能力。
  • 与现有模型的比较:gpt-oss-120b 的发布并未显著推动开源基础模型在生物能力方面的前沿,因为现有开源模型的默认性能往往已能匹配对抗性微调后的 gpt-oss-120b。

OpenAI 表示,此次发布是其致力于推动有益 AI 并提升整个 AI 生态系统安全标准承诺的一部分。

Sources