OpenAI 社区安全与暴力缓解框架

OpenAI 社区安全与暴力缓解框架

OpenAI 利用模型训练、自动检测系统和人工监督的组合,防止其服务被用于促进暴力或现实世界的伤害。该框架在用户自由和有用性之间取得平衡,对暴力行为的策划或执行采取零容忍政策。

通过模型训练和设计进行风险缓解

OpenAI 训练其模型以拒绝可能有意义地促进暴力的战术、规划或指令请求。系统的设计旨在区分有害请求与关于暴力的中性询问,这些询问可能出于教育、历史或预防目的。

关键组成部分包括:

  • 模型规范遵循: 框架遵循模型规范原则,在保持合理安全默认值的同时,最大化有用性和用户自由。
  • 上下文识别: OpenAI 已增强 ChatGPT 识别在长时间、高风险对话中出现的微妙警告信号的能力,因为单条消息可能看起来无害,而更广泛的模式则暗示风险。
  • 困境支持: 对于处于困境或有自伤风险的用户,ChatGPT 已接受训练,以避免促成有害行为,而是呈现本地化危机资源,并引导用户寻求心理健康专业人员或紧急服务。

监控与执行机制

OpenAI 采用分层检测和审查流程,以识别并应对与威胁、恐怖主义、骚扰和武器发展相关的政策违规。

自动检测

自动化系统使用多种工具大规模分析用户内容和行为:

  • 分类器和推理模型。
  • 哈希匹配技术。
  • 黑名单和其他监控系统。

人工审查与上下文评估

当自动化系统标记账户或对话时,受训人员会进行上下文审查。这些审查者在严格的隐私和安全防护下工作,仅限访问用户信息。目的是确定该活动是否违反政策或表明存在现实世界暴力的潜在风险,考虑到自动化系统可能遗漏的细微差别和意图。

执行行动

如果确认构成可封禁的违规行为,OpenAI 将立即撤销其服务访问权限。这可能包括禁用账户、封禁同一用户的关联账户,以及实施防止新账户创建的措施防止新账户创建的措施。用户创建的措施。用户保留对这些执行决定提出申诉的权利。

升级与现实世界干预

虽然大多数执行是在 OpenAI 与用户之间直接处理的,但某些高风险场景会触发外部升级。

  • 执法通知: 当对话表明对他人存在迫在眉睫且可信的伤害风险时,OpenAI 会通知执法部门。此过程涉及使用结构化标准以及来自心理健康和行为专家的输入进行深入调查。
  • 家长控制: 对于与家长账户关联的青少年账户,如果系统和人工审查者检测到急性困境的迹象,家长可能会通过电子邮件、短信或推送通知得到通知。
  • 可信联系人功能: OpenAI 正在推出一项功能,允许成年用户指定一个可信联系人,在用户可能需要额外支持时接收通知,该功能是在与全球医生网络和福祉与人工智能理事会合作下开发的。

持续改进与安全演进

OpenAI 根据新兴风险和专家输入迭代更新其模型、检测方法和升级标准。当前的优先事项包括改进对“困难情况”的处理,例如复杂的规避防护措施的尝试或风险不明显的模糊输入。

Sources