gpt-oss-safeguard 发布说明 / 新功能
OpenAI 已发布 gpt-oss-safeguard 的研究预览版,这是一套专为安全分类设计的开源权重推理模型。这些模型有两种规模——gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b——并通过 Hugging Face 以宽松的 Apache 2.0 许可证分发。
基于推理的安全分类
gpt-oss-safeguard 将安全分类范式从通过标记示例训练分类器以推断决策边界,转变为基于推理的方法。模型不再在训练期间将策略嵌入权重,而是在推理时直接解释开发者提供的策略。
关键技术能力
- Dynamic Policy Application: 开发者可以同时提供策略和待分类的内容。模型使用该策略判断内容是否违反所提供的具体规则,从而在应对不断变化的风险或细分领域时具有高度灵活性。
- Chain-of-Thought Reasoning: 模型在给出结论的同时输出达成该决定的推理过程。这提供了透明性,使开发者能够审查模型如何解释策略。
- Iterative Policy Refinement: 由于策略在推理时提供,开发者可以在无需重新训练模型的情况下修改安全指南。
理想使用场景
这种基于推理的方法在以下场景中特别有效:
- 潜在危害正在出现或快速演变,需要快速的策略调整。
- 领域高度细致,使得小型传统分类器难以处理。
- 训练数据不足,无法为每个特定风险构建高质量的分类器。
- 可解释性和高质量标签优先于低延迟。
与传统分类器的比较
传统安全分类器(例如 OpenAI Moderation API 中使用的)通常在数千个人工策划的安全与不安全内容示例上进行训练。虽然这些传统分类器具备低延迟和较低的运营成本,但它们需要大量时间和数据来开发和更新。
相比之下,gpt-oss-safeguard 允许开发者应用任何策略——包括自定义编写的——并利用推理在新策略之间进行泛化,使其用途超越安全,能够满足特定产品需求的通用内容标注。
内部实现:Safety Reasoner
gpt-oss-safeguard 是 OpenAI 内部使用的名为 Safety Reasoner 的工具的开源权重实现。该工具通过在策略标注任务上进行强化微调开发,奖励模型模仿人类专家判断。
OpenAI 在其内部基础设施中以多种方式使用 Safety Reasoner:
- Iterative Deployment: 新模型通常在严格的策略和高计算资源分配下部署,以便 Safety Reasoner 仔细应用这些策略,并在了解生产风险后调整策略。
- Real-time Blocking: 对于图像生成和 Sora 2,它执行逐步评估,以实时阻止不安全的生成。
- Multi-layered Defense: 在生物学和自残等领域,首先使用快速、高召回率的分类器识别感兴趣的内容,然后交由 Safety Reasoner 进行最终决策。
- System Integration: 它是 GPT-5 和 ChatGPT Agent 安全防护的一部分,对输出进行详细分类。
性能与基准测试
OpenAI 在内部和外部数据集上评估了 gpt-oss-safeguard:
- Multi-policy Accuracy: gpt-oss-safeguard 和内部 Safety Reasoner 在多策略准确率上优于 gpt-5-thinking 和 gpt-oss 开源模型。
- 2022 Moderation Evaluation Set: gpt-oss-safeguard 略微超越所有其他测试模型,包括 gpt-5-thinking 和内部 Safety Reasoner。
- ToxicChat: 在该数据集上,内部 Safety Reasoner 和 gpt-5-thinking 略微优于 gpt-oss-safeguard,尽管 OpenAI 指出 gpt-oss-safeguard 较小的规模使其在许多任务中更具优势。
局限性
基于推理的方法主要有两个局限:
- Performance Gap: 在数万条高质量标注样本上训练的分类器仍然可以在复杂风险上超越基于推理的模型。
- Compute and Latency: 该过程比传统分类器更耗算且更慢。OpenAI 在内部通过先使用较小的分类器过滤内容,或异步运行 Safety Reasoner 来保持低延迟的用户体验。
社区合作
OpenAI 与来自 Discord、Tomoro、SafetyKit 和 ROOST 的信任与安全专家合作开发了 gpt-oss-safeguard。作为本次发布的一部分,ROOST 正在 GitHub 上建立 ROOST Model Community (RMC),以分享将开源 AI 安全模型集成到工作流中的最佳实践。
Sources
- OriginalIntroducing gpt-oss-safeguard