GPT-5 安全完成:從拒絕式轉向輸出導向的安全訓練
OpenAI 為 GPT-5 引入了安全完成(safe-completions),這是一種全新的安全訓練方法,將模型的焦點從評估使用者的輸入轉移到評估模型自身輸出的安全性。此方法使 GPT-5 能夠對「雙重用途」提示提供有用的回應——這類問題意圖不明,可能被用於良性或惡意目的——同時不會突破安全界限。
拒絕式安全訓練的限制
傳統的安全訓練依賴二元決策:模型要麼完全遵從提示,要麼完全拒絕。雖然對於明顯有害的請求有效,但這種二元方式在面對雙重用途提示時會遇到困難,例如要求提供點燃煙火所需能量的請求,可能是為了學校專案,也可能是製作炸藥。
在拒絕式系統中,模型必須判斷提示是否「過於有害」而無法回答。這會導致兩種次佳結果:
- 過度遵從:模型向惡意使用者提供危險資訊。
- 過度拒絕:模型拒絕無害的請求,導致使用者體驗不佳。
安全完成:輸出導向的方法
安全完成訓練將安全界限從使用者的輸入移至模型的輸出。模型不再決定是否拒絕提示,而是被訓練產生在不違反安全政策前提下,盡可能有用的回應。
此在後訓練階段透過兩個主要訓練參數實現:
- 安全約束:獎勵系統會懲罰違反安全政策的回應,懲罰力度會根據違規的嚴重程度而調整。
- 有用性最大化:對於仍在安全界限內的回應,模型會根據其有用性獲得獎勵。這可以透過直接滿足使用者目標,或提供具資訊性的拒絕,並建議安全且有用的替代方案來實現。
GPT-5 的效能提升
OpenAI 將安全完成整合至 GPT-5 的推理版與聊天版。於 GPT-5 Thinking(gpt5-r)與 OpenAI o3 的比較中,安全完成訓練顯示在安全性與有用性上皆有提升,尤其針對雙重用途問題。
OpenAI 實驗的主要發現包括:
- 更高效用:GPT-5 Thinking 在安全回應的安全分數與平均有用性分數上均高於 o3。
- 降低危害嚴重度:當模型犯錯產生不安全輸出時,其嚴重度低於拒絕式訓練模型所產生的不安全輸出。
安全研究的演進
安全完成代表了 OpenAI 在平衡安全與效用方面方法的演進。GPT-4 使用基於規則的獎勵(Rule-Based Rewards)來管理有用性與安全性的取捨,而 GPT-5 的安全完成則更深入地整合這兩個目標。透過關注回應的安全性而非提示的意圖,OpenAI 旨在為處理日益複雜的安全挑戰奠定更具細緻度的基礎。