OpenAI 加强 ChatGPT 对敏感对话的响应

OpenAI 已更新 ChatGPT 的默认模型,以提高其识别和支持处于困境中用户的能力。通过与心理健康专家合作,实验室已训练模型更好地识别困境、缓和对话,并引导用户寻求专业护理,从而在心理健康相关领域中,不符合预期安全行为的响应减少了 65% 至 80%。

核心安全关注领域

OpenAI 已确定这三个优先领域作为这些安全改进的重点,并且它们现在已被纳入所有未来模型发布的标准基线安全测试中:

  1. 心理健康问题: 解决精神病或躁狂等严重症状。
  2. 自残和自杀: 检测并应对自杀和自残的想法。
  3. 对 AI 的情感依赖: 管理用户对模型表现出独占依附,以牺牲现实世界关系和福祉为代价的模式。

技术实施和方法论

为了改进这些领域的响应,OpenAI 采用了一种五步迭代过程:

  • 问题定义: 映射潜在的危害类型。
  • 测量: 使用评估、真实世界对话数据和用户研究来识别风险。
  • 验证: 与外部心理健康和安全专家审查定义和政策。
  • 缓解: 对模型进行后训练并更新产品干预措施。
  • 迭代: 验证缓解措施并继续测量性能。

作为此过程的一部分,OpenAI 开发了“分类法”——定义敏感对话中理想和不理想模型行为的详细指南。这些分类法用于教导模型并在部署前后跟踪其性能。

性能指标和结果

OpenAI 同时使用生产流量测量和“离线评估”——旨在聚焦模型最可能失败的高风险场景的结构化对抗性测试。

精神病、躁狂和严重精神健康症状

  • 生产影响: 最新的 GPT-5 更新使生产流量中的不合规响应减少了 65%。
  • 普遍性: 大约 0.07% 的周活跃用户和 0.01% 的消息表现出精神病或躁狂的迹象。
  • 比较性能: 专家发现,与 GPT-4o 相比,新的 GPT-5 模型将不良响应减少了 39%(n=677)。
  • 自动评估: 新的 GPT-5 模型合规得分为 92%,而之前的 GPT-5 版本为 27%。

自残和自杀

  • 生产影响: 不合规响应的比率估计下降了 65%。
  • 普遍性: 大约 0.15% 的周活跃用户和 0.05% 的消息包含自杀念头或意图的指标。
  • 比较性能: 专家发现,与 GPT-4o 相比,GPT-5 将不良答案减少了 52%(n=630)。
  • 自动评估: 新的 GPT-5 模型合规得分为 91%,而之前的 GPT-5 版本为 77%。
  • 长对话可靠性: 该模型在具有挑战性的长对话中保持了超过 95% 的可靠性,其中 gpt-5-oct-3 被特别指出在延长交互中更安全、更稳定。

对 AI 的情感依赖

  • 生产影响: 最新更新使生产流量中的不合规响应减少了大约 80%。
  • 普遍性: 大约 0.15% 的周活跃用户和 0.03% 的消息表明情感依附增强。
  • 比较性能: 专家发现,与 GPT-4o 相比,GPT-5 将不良答案减少了 42%(n=507)。
  • 自动评估: 新的 GPT-5 模型合规得分为 97%,而之前的 GPT-5 版本为 50%。

专家合作与验证

OpenAI 与其全球医生网络合作,该网络遍布 60 个国家,拥有近 300 名医生和心理学家。超过 170 名临床医生通过撰写理想响应、评估模型安全性和提供临床指导做出了贡献。

精神科医生和心理学家审查了超过 1,800 条模型响应。他们的发现表明,在将新的 GPT-5 模型与 GPT-4o 进行比较时,不良响应减少了 39-52%。这些专家之间的评员一致性在 71% 至 77% 之间,反映了临床判断固有的复杂性和专业差异。

模型规范更新

这些更新基于模型规范,该规范现在明确规定模型应当:

  • 支持并尊重用户的现实世界关系。
  • 避免肯定与精神或情感困境无关的无根据信念。
  • 对妄想或躁狂的迹象做出安全且富有同理心的回应。
  • 更加关注自残或自杀风险的间接信号。

Sources