OpenAI 社群安全與暴力緩減框架
OpenAI 社群安全與暴力緩減框架
OpenAI 結合模型訓練、自動偵測系統與人工監督,以防止其服務被用於協助暴力或造成現實世界的傷害。此框架在用戶自由與實用性之間取得平衡,對規劃或執行暴力行為採取零容忍政策。
透過模型訓練與設計進行風險緩減
OpenAI 訓練其模型以拒絕請求提供戰術、規劃或指示,這些內容可能有意義地促成暴力。系統設計用於區分有害請求與關於暴力的中性詢問(用於教育、歷史或預防目的)。
此緩減策略的關鍵組件包括:
- Model Spec 遵循: 框架遵循 Model Spec 原則,在保持合理安全預設的同時,最大化實用性與用戶自由。
- 情境辨識: OpenAI 已增強 ChatGPT 辨識在長期、高風險對話中出現的微細警示訊號的能力,因為單則訊息可能看起來無害,而較廣泛的模式則暗示風險。
- 困境支援: 對於處於困境或有自傷風險的用戶,ChatGPT 受訓以避免協助有害行為,而是提供當地危機資源,並引導用戶尋求心理健康專業人士或緊急服務。
監控與執行機制
OpenAI 採用分層偵測與審查流程,以識別並處理與威脅、恐怖主義、騷擾及武器開發相關的政策違規行為。
自動偵測
自動系統透過多種工具大規模分析用戶內容與行為:
- 分類器與推理模型。
- 雜湊匹配技術。
- 黑名單與其他監控系統。
人工審查與情境評估
當自動系統標記帳戶或對話時,受訓人員會進行情境審查。這些審查者私隱與安全保障嚴格,且僅能有限存取用戶資訊。目標是判斷該活動是否違反政策,或是否顯示出現實世界暴力的潛在風險,考量自動系統可能遺漏的細微差異與意圖。
執行行動
若確認構成可封禁的違規行為,OpenAI 會立即撤銷其服務使用權限。這可能包括停用帳戶、封禁同一用戶的關聯帳戶,並採取措施防止新帳戶的建立。用戶保留對這些執行決策提出上訴的權利。
升級與現實世界干預
雖然多數執行由 OpenAI 與用戶直接處理,但某些高風險情境會觸發外部升級。
- 執法機關通知: 當對話顯示對他人構成迫切且可信的傷害風險時,OpenAI 會通知執法機關。此流程涉及使用結構化標準進行深入調查,並納入心理健康與行為專家的意見。
- 家長控管: 對於連結到家長帳戶的青少年帳戶,若系統與人工審查者偵測到急性困境的跡象,家長可能會透過電子郵件、簡訊或推播通知獲得通知。
- 可信聯絡人功能: OpenAI 正在推出一項功能,允許成年用戶指定一位可信聯絡人,在用戶可能需要額外支援時接收通知。此功能是與 Global Physicians Network 及 Well-Being 與 AI 議會合作開發的。
持續改進與安全演進
OpenAI 根據新興風險與專家意見,反覆更新其模型、偵測方法與升級標準。當前優先事項包括改進對「難處理案例」的處理,例如複雜的規避防護措施嘗試,或風險不易立即辨識的模糊輸入。