OpenAI gpt-oss-safeguard 技術報告

OpenAI 已發布 gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b,這些是開放權重的推理模型,旨在根據提供的政策對內容進行分類。這些模型是在 gpt-oss 家族基礎上後續訓練得到的,並根據 Apache 2.0 授權提供。

模型版本與授權

gpt-oss-safeguard 模型提供兩種規模:120b 與 20b。這些模型僅為文字,且與 Responses API 相容。它們根據 Apache 2.0 授權以及 OpenAI 的 gpt-oss 使用政策發布。

技術能力與客製化

這些模型專為基於政策的內容分類而設計。它們經過優化,能夠根據提供的政策進行推理,以判斷內容是否應該被相應標記。關鍵技術特徵包括:

  • Chain-of-Thought (CoT): 模型提供完整的鏈式思考(CoT)推理,使用戶能夠看到達到分類決策所使用的內部邏輯。

  • Reasoning Effort Levels: 使用者可以配置模型以不同的推理力度(低、中、高)來平衡效能與延遲。

  • Structured Outputs: 模型支援結構化輸出(Structured Outputs),確保分類標籤以可預測、機器可讀的格式返回。

預期用途與應用

OpenAI 建議將 gpt-oss-safeguard 模型作為分類層使用,而非作為應用程式的核心使用者面向功能。就一般目的的互動而言,原始的 gpt-oss 模型更為適合。

安全與風險評估

由於這些模型是開放權重,OpenAI 進行了安全評估,以確保即使在聊天環境中使用時也能符合安全標準,儘管這不是他們的主要預期使用情境。

關於前沿風險,OpenAI 說明這些模型是在未額外加入任何生物或網路安全資料的情況下,從 gpt-oss 進行微調得到的。因此,在原始 gpt-oss 發布期間進行的風險評估——特別是估算最壞情況的工作——也適用於 gpt-oss-safeguard 系列。

Sources