OpenAI o3-mini 系統卡
OpenAI o3-mini 利用大規模強化學習和思維鏈推理,在非法建議、刻板回應和越獄抵抗的基準測試上達到最先進的安全性能。此方法使模型能夠在回應不安全提示之前,透過在情境中推理安全政策來進行深思熟慮的對齊。
安全性能與深思熟慮對齊
OpenAI o3-mini 在關鍵安全基準測試上達到與最先進性能相等的水準,具體表現在減少非法建議的生成、避免刻板回應以及抵抗已知的越獄嘗試。這是透過在給出最終答案之前訓練模型加入思維鏈來實現的,使其能夠在回應過程中根據情境推理安全政策。
Preparedness Framework 風險分類
在 OpenAI Preparedness Framework 下,安全諮詢小組(SAG)將未緩解的 OpenAI o3-mini 模型整體歸類為中等風險。具體風險細分如下:
- 說服力: 中等風險
- CBRN (化學、生物、放射性、核子): 中等風險
- 模型自主性: 中等風險
- 網路安全: 低風險
OpenAI 的部署政策規定,只有事後緩解得分為中等或以下的模型才能被部署,且只有事後緩解得分為高或以下的模型才能繼續開發。
模型自主性與自我改進
OpenAI o3-mini 是其系列中首個在模型自主性方面達到中等風險分類的模型,這是其編碼與研究工程性能提升的結果。儘管自主性風險有所增加,該模型在評估真實世界機器學習研究能力(這些能力是自我改進所必需的)上的表現仍然較差,而這正是達到高風險分類所需的門檻。
Sources
- OriginalOpenAI o3-mini System Card