gpt-oss-safeguard 版本說明 / 新功能
OpenAI 已發布 gpt-oss-safeguard 的研究預覽版,這是一組專為安全分類設計的開放權重推理模型。這些模型提供兩種規模——gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b——並透過 Hugging Face 以寬鬆的 Apache 2.0 授權發布。
基於推理的安全分類
gpt-oss-safeguard 將安全分類範式從訓練分類器以從標註樣本推斷決策邊界,轉變為基於推理的方法。與在訓練期間將政策烘焙進權重不同,該模型會直接在推理時解讀開發者提供的政策。
主要技術能力
- 動態政策應用: 開發者可以同時提供政策和待分類內容。模型會使用此政策來判斷內容是否違反所提供的具體規則,使其對於快速演變的風險或利基領域具有高度彈性。
- 思維鏈推理: 模型會輸出一個結論,並附帶達到該決策所使用的推理過程。這提供了透明度,並讓開發者可以檢視模型是如何解讀政策的。
- 迭代政策優化: 由於政策是在推理時提供的,開發者可以修訂他們的安全指南,而無需重新訓練模型。
理想使用案例
此基於推理的方法在以下情況下特別有效:
- 潛在危害正在新興或快速演變,需要快速調整政策。
- 網域高度細膩,導致較小的傳統分類器難以處理。
- 訓練資料不足,無法為每種特定風險建構高品質的分類器。
- 可解釋性和高品質標籤被優先考慮,而非低延遲。
與傳統分類器的比較
傳統安全分類器(例如 OpenAI Moderation API 所使用的那些)通常會在數千份經人工策劃的安全與不安全內容範例上進行訓練。雖然這些傳統分類器提供低延遲和較低的運營成本,但它們需要大量時間和資料來開發和更新。
相對地,gpt-oss-safeguard 允許開發者套用任何政策——包括自行撰寫的政策——並利用推理來跨新政策進行泛化,將其用途從安全擴展到針對特定產品需求的一般內容標註。
內部實作:安全推理器
gpt-oss-safeguard 是 OpenAI 內部工具 Safety Reasoner 的開放權重實作。該工具是透過在政策標註任務上的強化微調開發的,獎勵模型以鏡像人類專家的判斷。
OpenAI 利用 Safety Reasoner 在其自身基礎設施中有以下幾種方式:
- 迭代部署: 新模型通常會嚴格執行政策並為 Safety Reasoner 分配高計算資源進行部署,以謹慎應用這些政策,並在瞭解生產風險後調整政策。
- 即時封鎖: 對於圖像生成和 Sora 2,它會執行逐步評估以即時封鎖不安全的生成內容。
- 多層防禦: 在生物學和自傷等領域,會先使用快速且高召回率的分類器來識別感興趣的內容,然後由 Safety Reasoner 進行複審以做出最終決策。
- 系統整合: 它構成 GPT-5 和 ChatGPT Agent 安全防護的一部分,會根據詳細的分類體系對輸出進行分類。
效能與基準測試
OpenAI 在內部和外部資料集上評估了 gpt-oss-safeguard:
- 多政策準確率: gpt-oss-safeguard 與內部的 Safety Reasoner 在多政策準確率上均優於 gpt-5-thinking 和 gpt-oss 開放模型。
- 2022 年 Moderation 評估集: gpt-oss-safeguard 輕微優於所有其他測試模型,包括 gpt-5-thinking 和內部的 Safety Reasoner。
- ToxicChat: 在此資料集上,內部的 Safety Reasoner 和 gpt-5-thinking 略微優於 gpt-oss-safeguard,儘管 OpenAI 指出 gpt-oss-safeguard 的較小尺寸使其在許多任務中成為更佳選擇。
限制
基於推理的方法有兩項主要限制:
效能差距: 在數萬個高品質標註樣本上訓練的分類器,在複雜風險上仍可能優於基於推理的模型。
計算與延遲: 此過程比傳統分類器更耗計算資源且較慢。OpenAI 內部透過先使用較小的分類器過濾內容,或以非同步方式運行 Safety Reasoner 來管理此問題,以維持低延遲的使用者體驗。
社區合作
OpenAI 與 Discord、Tomoro、SafetyKit 和 ROOST 的信任與安全專家合作開發了 gpt-oss-safeguard。作為此次發布的一部分,ROOST 正在 GitHub 上建立 ROOST Model Community (RMC),以分享將開放原始碼 AI 安全模型實施到工作流程中的最佳實踐。
Sources
- OriginalIntroducing gpt-oss-safeguard