OpenAI 外部測試框架用於前沿 AI 安全

OpenAI 利用獨立的第三方評估來驗證安全聲明、識別盲點,並提高對前沿 AI 模型能力與風險的透明度。這些外部評估提供了一層獨立的嚴謹性,可防止自我確認,並為負責任的部署決策提供資訊。

外部評估的三種主要形式

OpenAI 與外部合作夥伴採用三種不同的合作模式來評估其模型:

1. 獨立評估

獨立實驗室使用自己的方法進行開放式測試,以產生關於特定前沿能力的主張或評估。

  • 在 GPT-5 的應用: OpenAI 協調了針對 GPT-5 的外部評估,重點放在長期自主性、謀划、欺騙、監督削弱、進攻性網路安全以及濕實驗室規劃可行性。
  • 存取層級: 為促進這些測試,OpenAI 提供安全的早期模型檢查點存取、零資料保留選項,以及減少緩解措施的模型(例如「僅有幫助」模型)。
  • 推理透明度: 某些組織獲得了直接的思維鏈存取,以檢查推理痕跡,這使評估者能夠識別如沙袋策略或謀划等行為——這些行為在最終輸出中通常是不可見的。

2. 方法論審查

當重複評估所需的基礎設施或技術專業知識在主要 AI 實驗室以外不常見時,會使用方法論審查。在此情況下,外部評估者會審查實驗室的內部框架和證據,以提出建議。

  • 在 gpt-oss 的應用: 對於 gpt-oss 開放權重模型,OpenAI 使用對抗性微調來估算生物和網路領域的最壞案風險。外部評估者審查了內部方法和結果,提供了導致最終對抗性微調過程變更的回饋。
  • 結果: 這些評估的結果——包括哪些建議被採納以及未被採納的理由——都記錄在模型的系統卡和相關研究論文中。

3. 主題專家(SME)探針

SME 探針涉及專家直接在真實世界任務上評估模型,以透過調查提供結構化輸入。這與紅隊測試不同,因為它專注於評估能力,而不是對特定防護措施進行壓力測試。

  • 在 ChatGPT Agent 和 GPT-5 的應用: 專家使用僅有幫助的模型來測試端到端的生物場景。他們對模型的 "novice uplift" 進行評分——該指標衡量模型將有動機的新手推向熟練執行的程度,相較於專家自身的能力。
  • 整合: 此專家判斷用於補充 Preparedness Framework 評估,以加入靜態評估可能遺漏的真實世界背景。

第三方合作的原則

OpenAI 根據三項核心原則來結構其外部合作,以平衡透明度與安全性:

  • 保密與發布: 評估者簽署保密協議(NDA)以存取非公開資訊。OpenAI 在發布前會審查出版物的保密性和事實準確性。已發布的外部工作範例包括 METR 對 GPT-5 的報告和 Apollo Research 對 OpenAI o1 的報告。
  • 安全存取: 對於敏感模型(例如沒有安全緩解措施的模型)的存取僅在針對關鍵安全問題時必要時才會授予,並受嚴格且不斷演變的安全控管規範。
  • 財務永續性: OpenAI 會向所有第三方評估者提供報酬——透過直接付款或 API 點數——以確保生態系統的永續性。報酬永不取決於評估結果。

更廣泛的安全生態系統

外部測試是更大安全策略的一部分。OpenAI 也與美國 CAISI 和英國 AISI 合作,參與集體對齊項目,並利用諮詢團體如 Global Physician Network 和 Expert Council on Well-Being and AI 來指導心理健康和使用者福祉的工作。

Sources