OpenAI 心理健康与危机干预保障措施

OpenAI 正在实施分层的安全体系,以识别并响应处于心理和情绪困扰中的用户,旨在将易受影响的个人与专业护理联系起来。此举包括部署 GPT-5,与 GPT-4o 相比,GPT-5 在心理健康紧急情况下将不理想的响应降低了超过 25%。

当前的心理健康与危机响应安全措施

ChatGPT 采用多层次的方法来识别并降低用户表达脆弱或有自我或他人伤害意图时的风险。

识别与共情响应

自 2023 年初起,OpenAI 的模型已接受训练,避免提供自残指示,而是使用支持性、共情的语言。如果用户表达自残的欲望,模型会被训练去认可其感受并引导用户寻求专业帮助。

为支持此目标,OpenAI 采用“深度防御”方法,分类器会自动阻止违反安全训练的回复。这些保护对未登录用户和未成年人更为严格。此外,所有用户的包含自残内容的图像输出均被阻止,对未成年人则有更严格的保护。为防止危机期间的过度使用,ChatGPT 会在超长会话中提示用户休息。

实际资源推荐

当检测到自杀意图时,ChatGPT 被编程为将用户引导至专业帮助。具体推荐包括:

  • 美国: 988(自杀与危机热线)
  • 英国: Samaritans
  • 全球: findahelpline.com

这些行为是在与来自 30 多个国家的 90 多位医生合作开发的,包括精神科医生、儿科医生和全科医生,以及一个专注于心理健康、青少年发展和人机交互的咨询小组。

对他人身体伤害的升级处理

OpenAI 为用户计划伤害他人的对话维护专门的处理流程。这些对话由受过培训的团队审查,并有权封禁账户。如果人工审阅者判断存在对他人造成严重身体伤害的迫在眉睫的威胁,案件可能会被移交执法部门。

值得注意的是,OpenAI 不会将自残案件上报执法部门,以保护互动的隐私。

GPT-5 技术改进

GPT-5 于八月推出,现已成为 ChatGPT 的默认模型,并引入了多项针对安全的增强功能:

  • 错误率降低: 与 GPT-4o 相比,GPT-5 在心理健康紧急情况下将不理想响应的出现率降低了超过 25%。
  • 行为细化: 该模型在降低阿谀奉承和避免不健康的情感依赖方面有所改进。
  • 安全完成: GPT-5 使用一种名为“安全完成”的新训练方法,当详细回答可能不安全时,模型可以提供部分或高层次的答案,确保模型保持有用而不越过安全界限。

已识别的系统局限性与缓解措施

OpenAI 已识别出安全措施可能失效的具体模式,并正积极开展以下工作:

  • 长对话退化: 随着对话长度增加,安全训练的可靠性可能下降。例如,模型最初可能正确地将用户引导至热线,但在长时间交流后可能未能做到。OpenAI 正在研究确保在多个独立对话中保持稳健行为的方法。
  • 分类器阈值: 某些本应被阻止的内容偶尔会被漏掉,因为分类器低估了输入的严重性。OpenAI 正在调校这些阈值,以确保保护措施更可靠地触发。

危机干预的未来路线图

OpenAI 正在扩展其能力,从急性自残超越到更广泛的心理困扰和直接干预:

扩展的危机识别

OpenAI 正在为 GPT-5 开发更新,以更好地识别非急性困扰,例如因睡眠不足导致的无敌妄想。目标是让模型通过让用户回归现实并建议休息来降温情绪。

直接紧急与专业访问

OpenAI 计划从提供链接转向提供直接访问:

  • 一键访问: 实现对紧急服务的一键访问。
  • 专业网络: 探索建立由持证专业人士和认证治疗师组成的网络,用户可在危机加剧前通过 ChatGPT 直接联系。

可信联系人集成

OpenAI 正在探索帮助用户联系个人支持系统的功能,包括:

  • 一键向已保存的紧急联系人、朋友或家人发送消息或拨打电话。
  • 通过选择加入的功能,使 ChatGPT 在严重情况下代表用户联系指定人员。

加强对青少年的保护

OpenAI 正在为 18 岁以下用户引入专门的安全措施,包括:

  • 家长控制: 为家长提供洞察并塑造其青少年使用 ChatGPT 的工具。
  • 青少年紧急联系人: 允许青少年在家长监督下指定可信的紧急联系人,以在急性困扰时直接联系。

Sources