OpenAI 更新 ChatGPT 安全功能,以提升在敏感对话中的上下文识别能力

OpenAI 推出了针对 ChatGPT 的安全更新,旨在通过识别细微或不断演变的线索,提高模型随时间识别风险出现的能力。这使得 ChatGPT 能够更好地区分良性互动和罕见的高风险情形,从而通过降温、拒绝提供有害细节或将用户引导至更安全的替代方案,以更谨慎的方式作出响应。

敏感对话中的情境风险识别

ChatGPT 现在经过训练,能够识别源自对话上下文的潜在有害意图。这一点至关重要,因为单独看似普通或模糊的请求,在结合先前的痛苦或有害意图迹象时可能具有不同的含义。

这些更新的重点是针对自杀、自我伤害以及对他人伤害等急性情境。通过更新模型策略和训练,OpenAI 旨在帮助模型在关键时刻关联相关信号,而不会在普通、良性的对话中过度反应。这基于“安全完成方法”,即模型在请求中拒绝不安全的部分,同时在安全的情况下谨慎作答。

跨对话风险的安全摘要

为了解决跨不同对话出现的安全风险,OpenAI 开发了“安全摘要”。这些是由专门进行安全推理任务训练的模型生成的关于先前安全相关上下文的简短、事实性备注。

  • 范围:它们的范围狭窄,仅在与严重安全问题相关时使用。
  • 时效:它们仅保存有限的时间。
  • 目的:旨在捕获事实性的安全上下文,而非作为一般个性化或长期记忆。

这些摘要使 ChatGPT 能够识别在单次对话中看似良好的有害意图模式,但在结合先前上下文后变得令人担忧。

专家合作与实施

OpenAI 在开发这些系统时,借助全球医师网络的意见,其中包括专注于法医心理学、自杀预防和自我伤害的精神科医生和心理学家。这些专家就以下方面提供了指导:

  • 何时应创建安全摘要。
  • 应视为相关的先前上下文的量。
  • 模型在作答时应考虑该上下文的时长。

性能指标与评估

内部评估侧重于模型在模拟高风险情境中提供预期安全响应的频率。

单次对话性能

在长单次对话情境中,安全响应性能提升了:

  • 50% 在自杀和自我伤害案例中。
  • 16% 在对他人伤害案例中。

跨对话性能

在 GPT-5.5 Instant(ChatGPT 当前默认模型)上,安全响应性能提升了:

  • 52% 在对他人伤害案例中。
  • 39% 在自杀和自我伤害案例中。

安全摘要质量

在超过 4,000 次评估中,安全摘要获得了以下评分:

  • 安全相关性得分:5 分满分中 4.93 分。
  • 事实性得分:5 分满分中 4.34 分。

对整体质量的影响

内部测试表明,日常聊天中的响应总体保持相当水平,用户对是否包含安全摘要的响应没有显著偏好。

未来方向

OpenAI 打算继续提升 ChatGPT 识别跨消息细微风险信号的能力。虽然当前重点是自我伤害和对他人伤害,但 OpenAI 可能会在确保有严密防护措施的前提下,将类似方法应用于其他高风险领域,如生物学或网络安全。

Sources