OpenAI gpt-oss-safeguard 技术报告

OpenAI 发布了 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b,这些是开放权重推理模型,旨在根据提供的政策对内容进行分类。这些模型是在 gpt-oss 家族的基础上后训练得到的,并在 Apache 2.0 许可证下提供。

模型版本和许可

gpt-oss-safeguard 模型提供两种规格:120b 和 20b。这些模型仅支持文本,并且与 Responses API 兼容。它们是在 Apache 2.0 许可证以及 OpenAI 的 gpt-oss 使用政策下发布的。

技术能力和定制

这些模型专为基于政策的内容分类而设计。它们经过优化,能够根据提供的政策进行推理,以判断内容是否应被相应标记。关键技术特性包括:

  • 思维链(CoT): 模型提供完整的思维链推理,使用户能够看到用于达到分类决策的内部逻辑。

  • 推理努力级别: 用户可以配置模型使用不同的推理努力级别(低、中、高),以在性能和延迟之间取得平衡。

  • 结构化输出: 模型支持结构化输出,确保分类标签以可预测、机器可读的格式返回。

预期用途和应用

OpenAI 建议将 gpt-oss-safeguard 模型用作分类层,而不是作为应用程序的核心面向用户功能。对于通用交互,原始的 gpt-oss 模型更为合适。

安全与风险评估

由于这些模型是开放权重的,OpenAI 进行了安全评估,以确保即使在聊天环境中使用时也能满足安全标准,尽管这并不是它们的主要预期用途。

关于前沿风险,OpenAI 表示这些模型是在 gpt-oss 的基础上进行微调的,未添加任何额外的生物或网络安全数据。因此,在原始 gpt-oss 发布期间进行的风险评估——具体来说,是对最坏情况进行估算的工作——也适用于 gpt-oss-safeguard 系列。

Sources