OpenAI 更新 ChatGPT 安全功能,以提升在敏感對話中的情境辨識

OpenAI 已推出針對 ChatGPT 的安全更新,旨在提升模型辨識風險隨時間出現的能力,透過識別微妙或演變的線索。這使得 ChatGPT 能更好地區分良性互動與罕見的高風險情況,從而在回應時更謹慎,透過降溫、拒絕有害細節或將使用者導向更安全的替代方案。

敏感對話中的情境風險辨識

ChatGPT 現已接受訓練,能辨識來自對話情境的潛在有害意圖。這點至關重要,因為單獨看似普通或模糊的請求,若與先前的痛苦或有害意圖跡象一起檢視,可能具有不同的含義。

這些更新的重點是針對涉及自殺、自我傷害與對他人造成傷害的急性情境。透過更新模型政策與訓練,OpenAI 旨在協助模型在關鍵時刻連結相關訊號,同時避免在普通、良性的對話中過度反應。此做法建立在「安全完成方法」之上,模型會拒絕請求中不安全的部分,並在安全的情況下謹慎回應。

跨對話風險的安全摘要

為了解決跨不同對話出現的安全風險,OpenAI 開發了「安全摘要」。這些是由專門訓練於安全推理任務的模型所產生的、關於先前與安全相關情境的簡短、事實性備註。

安全摘要的主要特徵包括:

  • 範圍:僅限於與嚴重安全關切相關時使用,範圍狹窄。
  • 持續時間:保存時間有限。
  • 目的:旨在捕捉事實性的安全情境,而非作為一般個人化或長期記憶。

這些摘要使 ChatGPT 能辨識在單一對話中看似良性的有害意圖模式,當與先前情境結合時則可能變得令人關切。

專家合作與實作

OpenAI 在開發這些系統時,諮詢了全球醫師網路的意見,該網路包括專精於法醫心理學、自殺防治與自我傷害的精神科醫師與心理學家。這些專家提供了以下指導:

  • 何時應建立安全摘要。
  • 應視為相關的先前情境量。
  • 模型在回應時應考慮該情境的持續時間。

效能指標與評估

內部評估聚焦於模型在模擬高風險情境中提供預期安全回應的頻率。

單次對話效能

在長時間的單次對話情境中,安全回應效能提升了:

  • 50% 在自殺與自我傷害案例中。
  • 16% 在對他人造成傷害的案例中。

跨對話效能

在 GPT-5.5 Instant(ChatGPT 目前的預設模型)上,安全回應效能提升了:

  • 52% 在對他人造成傷害的案例中。
  • 39% 在自殺與自我傷害的案例中。

安全摘要品質

在超過 4,000 次評估中,安全摘要獲得以下分數:

  • 安全相關性分數:5 分滿分中 4.93 分。
  • 事實性分數:5 分滿分中 4.34 分。

對整體品質的影響

內部測試顯示,日常聊天的回應整體上仍相當可比,使用者對有無安全摘要的回應並無顯著偏好。

未來方向

OpenAI 計畫持續提升 ChatGPT 識別跨訊息散布的微妙風險訊號的能力。雖然目前的重點是自我傷害與對他人造成傷害,OpenAI 亦可能在確保有謹慎防護措施的前提下,探索將類似方法應用於其他高風險領域,如生物學或網路安全。

Sources