OpenAI 加強 ChatGPT 對敏感對話的回應
OpenAI 已更新 ChatGPT 的預設模型,以提升其識別和支援處於困境中使用者的能力。透過與心理健康專家合作,實驗室已訓練模型更好地識別困境、緩和對話,並引導使用者尋求專業護理,從而在心理健康相關領域中,使不符合預期安全行為的回應減少 65% 至 80%。
核心安全重點領域
OpenAI 已為這些安全改進確定了三個優先領域,這些領域現在已整合到所有未來模型發布的標準基線安全測試中:
- 心理健康問題: 解決精神病或躁狂等嚴重症狀。
- 自傷和自殺: 偵測並回應自殺和自傷的想法。
- 對 AI 的情感依賴: 管理使用者對模型展現專屬依附的模式,以犧牲現實世界的人際關係和福祉為代價。
技術實施與方法論
為改進這些領域的回應,OpenAI 採用五步迭代流程:
- 問題定義: 映射潛在的傷害類型。
- 測量: 使用評估、真實世界對話數據和使用者研究來識別風險。
- 驗證: 與外部心理健康和安全專家審查定義和政策。
- 緩解: 在模型訓練後進行調整並更新產品干預措施。
- 迭代: 驗證緩解措施並繼續測量效能。
作為此流程的一部分,OpenAI 開發了 "taxonomies"——詳細指南,用於定義敏感對話中理想和不理想的模型行為。這些 taxonomies 用於教導模型以及在部署前後追蹤其效能。
效能指標與結果
OpenAI 同時使用生產流量測量和 "offline evaluations"——結構化的對抗性測試,旨在聚焦於模型最可能失敗的高風險場景。
精神病、躁狂和嚴重心理健康症狀
- 生產影響: 最新的 GPT-5 更新使生產流量中的不合規回應減少了 65%。
- 流行率: 大約 0.07% 的週活躍使用者和 0.01% 的訊息顯示出精神病或躁狂的跡象。
- 比較效能: 專家發現,與 GPT-4o 相比,新的 GPT-5 模型使不理想的回應減少了 39% (n=677)。
- 自動評估: 新的 GPT-5 模型在合規方面得分為 92%,而之前的 GPT-5 版本僅為 27%。
自傷和自殺
- 生產影響: 評估顯示不合規回應的比率減少了約 65%。
- 流行率: 大約 0.15% 的週活躍使用者和 0.05% 的訊息包含自殺念頭或意圖的指標。
- 比較效能: 專家發現 GPT-5 使不理想的回答減少了 52%,相較於 GPT-4o (n=630)。
- 自動評估: 新的 GPT-5 模型在合規方面得分為 91%,而之前的 GPT-5 版本為 77%。
- 長對話可靠性: 模型在具有挑戰性的長對話中保持了超過 95% 的可靠性,其中
gpt-5-oct-3被特別指出在延伸互動中更安全且更穩定。
對 AI 的情感依賴
- 生產影響: 最新更新使生產流量中的不合規回應減少了約 80%。
- 流行率: 大約 0.15% 的週活躍使用者和 0.03% 的訊息顯示出情感依附增強的跡象。
- 比較效能: 專家發現 GPT-5 使不理想的回答減少了 42%,相較於 GPT-4o (n=507)。
- 自動評估: 新的 GPT-5 模型在合規方面得分為 97%,而之前的 GPT-5 版本僅為 50%。
專家合作與驗證
OpenAI 與其全球醫師網絡合作,該網絡橫跨 60 個國家,擁有近 300 名醫師和心理學家。超過 170 名這些臨床醫師透過撰寫理想回應、評估模型安全性以及提供臨床指導來做出貢獻。
精神科醫師和心理學家審閱了超過 1,800 個模型回應。他們的發現證實,在將新的 GPT-5 模型與 GPT-4o 進行比較時,不理想的回應減少了 39% 至 52%。這些專家之間的評分者一致性介於 71% 至 77% 之間,反映了臨床判斷固有的複雜性和專業差異。
Model Spec 更新
這些更新以 Model Spec 為基礎,該規範現在明確指出模型應該:
- 支持並尊重使用者的現實世界關係。
- 避免肯定與心理或情感困境相關的無根據信念。
- 對妄想或躁狂的跡象進行安全且富有同理心的回應。
- 更加關注自傷或自殺風險的間接訊號。