OpenAI gpt-oss-safeguard 模型通过 Ollama 发布

TL;DR

OpenAI、Ollama 和 ROOST 宣布在 Apache 2.0 许可下发布开源的 gpt-oss-safeguard 模型(20B 和 120B 参数),提供了一种基于推理的安全分类器,能够解释用户定义的任意策略并展示其思维链决策过程。


模型可用性与许可

核心要点: 模型可以免费下载,可通过 Ollama 运行,并采用宽松的 Apache 2.0 许可,消除了商业或实验用途中的 copyleft 和专利担忧。

  • 提供两种模型尺寸:gpt-oss-safeguard:20bgpt-oss-safeguard:120b
  • 安装步骤简单:下载 Ollama,然后运行 ollama run gpt-oss-safeguard:20b(或 :120b)。
  • Apache 2.0 许可允许不受限制的修改、重新分发和商业部署。

核心技术特性

核心要点: 模型专为安全推理而构建,支持自定义策略、透明的推理输出以及可调节的推理强度。

以安全为中心的训练

  • 专门针对安全分类任务进行训练和微调,例如输入-输出过滤、在线内容标注以及离线信任与安全流水线。

自带策略 (BYOP)

  • 模型在推理时接受文本形式的策略描述,并将其应用于各种产品,无需额外的工程化工作。

基于推理的决策而非原始分数

  • 返回完整的思维链 (CoT) 解释,使开发者能够调试和审计决策。
  • 原始 CoT 输出旨在供安全从业者使用,而非最终用户。

可配置的推理强度

  • 用户可以选择低、中、高三种推理强度,在延迟与分析深度之间进行权衡。

评估结果

核心要点: OpenAI 的内部和外部基准测试显示,gpt-oss-safeguard 能够准确地针对多个同时进行的策略对文本进行分类,并在已有的审核机制数据集上表现出竞争力。

  • 内部多策略测试: 仅当模型的标签与所有提供的策略对应的金标准集匹配时,才计算准确率,这是一个非常严格的标准。
  • OpenAI Moderation Dataset (2022): 模型在与 OpenAI 2022 年审核研究论文发布的相同数据集上进行了评估。
  • ToxicChat Benchmark: 性能也在公开的 ToxicChat 基准测试中进行了衡量,该测试反映了用户向开源聊天机器人提出的真实世界查询。

Internal multi-policy evaluation OpenAI moderation benchmark ToxicChat benchmark


社区与组织背景

核心要点: 该发布由致力于开源安全工具的非营利组织 ROOST 支持,强调了向透明、社区驱动的 AI 安全基础设施迈进的更广泛趋势。

“gpt-oss-safeguard 是第一个具有‘自带策略和危害定义’设计的开源推理模型。组织应当能够自由地研究、修改和使用关键的安全技术并进行创新。在我们的测试中,它在理解不同策略、解释其推理过程以及在应用策略时表现出细微差别方面表现出色,我们相信这对构建者和安全团队都大有裨益。”Vinay Rao, CTO of ROOST

关于 ROOST

  • ROOST (Robust Open Online Safety Tools) 是一个成立于 2025 年的非营利组织,旨在为数字组织提供高质量的开源安全工具。
  • 它由技术公司、慈善团体和学术界组成的联盟支持。

入门资源

核心要点: 开发者可以参考官方指南和社区仓库来将模型集成到其流水线中。


对 AI 安全格局的影响

核心要点: 通过以宽松的许可发布一个高容量、策略驱动的安全模型,OpenAI 及其合作伙伴降低了降低了组织实施强效内容审核机制的门槛,可能加速行业和研究领域对负责任 AI 实践的采用。

  • BYOP 设计减少了对定制化安全模型训练的需求,节省了小型团队的资源。

  • 透明的推理过程促进了信任并有助于在需要可解释性要求的监管合规性方面发挥作用。

  • 开放许可鼓励社区审计、扩展和与多样化生态系统的集成,从而减轻了供应商锁定风险。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch