OpenAI gpt-oss-safeguard 模型透過 Ollama 發佈
TL;DR
OpenAI、Ollama 與 ROOST 宣布在 Apache 2.0 授權下發佈開源的 gpt-oss-safeguard 模型(20B 與 120B 參數),提供一種基於推理的安全分類器,能夠解釋任意使用者定義的政策,並揭示其思維鏈(chain-of-thought)決策過程。
模型可用性與授權
重點摘要: 模型可免費下載,並可透過 Ollama 執行,且採用寬鬆的 Apache 2.0 授權,消除了商業或實驗用途中的 copyleft 與專利疑慮。
- 提供兩種模型大小:
gpt-oss-safeguard:20b與gpt-oss-safeguard:120b。 - 安裝步驟簡單:下載 Ollama,然後執行
ollama run gpt-oss-safeguard:20b(或:120b)。 - Apache 2.0 授權允許不受限制的修改、重新分發與商業部署。
核心技術特性
重點摘要: 模型專為安全推理而設計,支援自定義政策、透明的推理輸出以及可調整的推理強度。
以安全為核心的訓練
- 專門針對安全分類任務進行訓練與微調,例如輸入-輸出過濾、線上內容標籤化以及離線信任與安全管線。
自帶政策 (Bring-Your-Own-Policy, BYOP)
- 模型在推理時接受文字形式的政策描述,並能在無需額外工程開發的情況下,將其應用於各種產品中。
以推理決策取代原始分數
- 回傳完整的思維鏈 (CoT) 解釋,使開發者能夠對決策進行除錯與審計。
- 原始的 CoT 輸出旨在提供給安全從業者,而非終端使用者。
可配置的推理強度
- 使用者可以選擇低、中、高三種推理強度,在延遲與分析深度之間進行權衡。
評估結果
重點摘要: OpenAI 的內部與外部基準測試顯示,gpt-oss-safeguard 能準確地根據多個同時進行的政策對文本進行分類,並在既有的內容審核機制數據集上表現出競爭力。
- 內部多政策測試: 僅當模型的標籤與所有提供的政策之黃金標準集 (gold set) 相符時,才計算準確度,這是一個嚴格的標準。
- OpenAI Moderation Dataset (2022): 模型在與 OpenAI 2022 年內容審核研究論文發佈的相同數據集上進行了評估。
- ToxicChat Benchmark: 效能表現也在公開的 ToxicChat 基準測試中進行了衡量,該測試反映了使用者對開源聊天機器人的真實世界查詢。
社群與組織背景
重點摘要: 此發佈由致力於開源安全工具的非營利組織 ROOST 提供支持,強調了邁向透明、社群驅動的 AI 安全基礎設施的廣泛趨勢。
“gpt-oss-safeguard 是第一個具備『自帶政策與危害定義』設計的開源推理模型。組織應該能夠自由地研究、修改並使用關鍵的安全技術,並具備創新能力。在我們的測試中,它能巧妙地理解不同政策,解釋其推理過程,並在應用政策時展現出細微差別,我們相信這對開發者與安全團隊將非常有益。” – Vinay Rao, CTO of ROOST
關於 ROOST
- ROOST (Robust Open Online Safety Tools) 是一個成立於 2025 年的非營利組織,旨在為數位組織提供高品質的開源安全工具。
- 它由技術公司、慈善團體與學術界組成的聯盟提供支持。
入門資源
重點摘要: 開發者可以參考官方指南與社群儲存庫來將模型整合至其管線中。
- OpenAI blog post: https://openai.com/index/introducing-gpt-oss-safeguard/
- Developer cookbook: https://cookbook.openai.com/articles/gpt-oss-safeguard-guide
- ROOST model community repo: https://github.com/roostorg/open-models
對 AI 安全領域的影響
重點摘要: 透過在寬鬆的授權下發佈高容量、政策驅動的安全模型,OpenAI 與其合作夥伴降低了組織實施強大內容審核的門檻,可能加速產業與研究領域對負責任 AI 實踐的的採用。
BYOP 設計減少了對客製化安全模型訓練的需求,節省了小型團隊的資源。
透明的推理過程促進了信任,並在需要可解釋性的法規遵循情境下提供了便利。
開源授權鼓勵社群審計、擴充與各種生態系統的整合,從而降低了供應商鎖定的風險。
Sources
- OriginalOpenAI gpt-oss-safeguard
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch