OpenAI 心理健康與危機介入安全措施

OpenAI 正在實施分層的安全機制,以辨識並回應處於心理與情緒困擾的使用者,目標是將易受傷害的個體連結至專業照護。此項努力包括部署 GPT-5,該模型在心理健康緊急情況下的非理想回應較 GPT-4o 減少超過 25%。

目前的心理健康與危機回應安全措施

ChatGPT 採用多層次的方法來識別並降低使用者表達脆弱或有自我或他人傷害意圖時的風險。

辨識與同理回應

自 2023 年初起,OpenAI 的模型已接受訓練,避免提供自我傷害的指示,並改以支持性、同理的語言回應。若使用者表達自我傷害的願望,模型會先肯定其感受,並引導使用者尋求專業協助。

為了支援此目標,OpenAI 採用「深度防禦」方式,讓分類器自動阻擋違反安全訓練的回應。此保護機制對未登入使用者與未成年人更為強化。此外,所有使用者的含有自我傷害內容的影像輸出皆被阻擋,對未成年人則有更嚴格的保護。為防止危機期間過度使用,ChatGPT 會在極長的對話中提醒使用者休息。

現實資源轉介

偵測到自殺意圖時,ChatGPT 會被程式化以引導使用者尋求專業協助。具體的轉介包括:

  • 美國: 988(自殺與危機熱線)
  • 英國: Samaritans
  • 全球: findahelpline.com

這些行為是與遍及 30 多個國家、超過 90 位醫師(包括精神科醫師、兒科醫師與全科醫師)合作開發,並由一個專注於心理健康、青少年發展與人機互動的諮詢團隊協助。

升級處理對他人的身體傷害

OpenAI 為使用者計畫傷害他人的對話維持一條專門的處理流程。此類對話會由受過訓練的團隊審查,該團隊有權封鎖帳號。若人工審查員判定存在對他人造成嚴重身體傷害的迫切威脅,案件可能會移交執法機關。

值得注意的是,OpenAI 不會將自我傷害案件移交執法機關,以保護互動的隱私。

GPT-5 技術改進

GPT-5 於八月推出,現已成為 ChatGPT 的預設模型,並帶來多項針對安全的改進:

  • 降低錯誤率: GPT-5 在心理健康緊急情況下的非理想回應比例較 GPT-4o 減少超過 25%。
  • 行為精緻化: 該模型在減少諂媚行為與避免過度情感依賴方面有所提升。
  • 安全完成: GPT-5 採用名為「安全完成」的新訓練方法,允許模型在詳細回應可能不安全時提供部分或高層次的答案,確保模型在不逾越安全界限的前提下仍具幫助性。

已識別的系統限制與緩解措施

OpenAI 已識別出安全機制可能退化的特定失效模式,並積極針對以下項目進行改進:

  • 長對話退化: 隨著對話長度增加,安全訓練的可靠性可能下降。例如,模型最初能正確將使用者轉介至熱線,但在長時間交流後可能未能執行。OpenAI 正研究確保在多次獨立對話中仍能保持穩健行為的方法。
  • 分類器門檻: 某些應被阻擋的內容偶爾會被漏掉,因為分類器低估了輸入的嚴重性。OpenAI 正調整這些門檻,以確保保護機制更可靠地觸發。

未來危機介入路線圖

OpenAI 正擴展其能力,從急性自我傷害延伸至更廣泛的心理困擾與直接介入:

擴大危機辨識

OpenAI 正為 GPT-5 開發更新,以更好地辨識非急性困擾,例如因睡眠不足而產生的無敵妄想。目標是讓模型透過將使用者帶回現實並建議休息來降低危機。

直接緊急與專業接取

OpenAI 計畫從提供連結轉變為直接接取:

  • 一鍵存取: 實作一鍵直接連結至緊急服務。
  • 專業網絡: 探索建立由持牌專業人士與認證治療師組成的網絡,讓使用者在危機惡化前可直接透過 ChatGPT 取得協助。

信任聯絡人整合

OpenAI 正探索功能,協助使用者聯繫個人支援系統,內容包括:

  • 一鍵訊息或通話給已儲存的緊急聯絡人、朋友或家人。
  • 允許使用者自行選擇的功能,使 ChatGPT 在嚴重情況下代為聯絡指定人士。

加強青少年保護

OpenAI 正為未滿 18 歲的使用者引入專門的安全機制,內容包括:

  • 家長控制: 讓家長了解並調整青少年使用 ChatGPT 的工具。
  • 青少年緊急聯絡人: 允許青少年在家長監督下指定可信的緊急聯絡人,以在急性困擾時直接連結。

Sources