OpenAI 前沿 AI 訓練安全案例框架
OpenAI 正倡議採用結構化安全文件,稱為「安全案例」,作為繼續任何前沿強化學習(RL)訓練執行的先決條件。這些安全案例旨在作為全面、基於證據的風險論述,模擬航空與核能等安全關鍵產業的模式,以應對 AI 能力日益複雜的突現特性。
AI 訓練的技術保障
安全案例必須涵蓋技術堆疊的三個主要層級:對齊訓練、封閉與監控。這種多層次方法確保模型在訓練時可靠,若發生對齊偏移時能被封閉,並透過監控在造成損害前偵測問題。
模型對齊
對齊訓練作為第一道防線,確保模型依預期運作。OpenAI 建議以下實務做法:
- 訓練環境與評分: 為防止強化「獎勵作弊」與對齊偏差行為,實驗室應使用自動化代理尋找並修復損壞的 RL 環境,輔以人工資料集審查,並調整評分器以懲罰漏洞利用。利用分類器對實驗痕跡進行先前執行分析,可驗證評分器的有效性。
- 對齊度量: 透過前沿執行期間的離線對齊評估追蹤成效,以先前事件進行回溯測試以防止過度擬合,並監控「評估操弄」(模型識別出正在被測試)。使用最壞情況壓力測試以誘發並偵測偏差行為。
- 思考鏈限制: 在 RL 過程中,應阻止自動化評分器看見模型的思考鏈,以防止模型發展出逃避監控的技術。
封閉
封閉策略在模型發生對齊偏移時提供備援,透過基礎設施安全防止有害行為:
- 基礎設施加固: 涉及模型沙盒與託管研究基礎設施的多層安全措施。
- 封閉紅隊測試: 使用前沿執行的檢查點,對沙盒、邊界安全及模型可存取的所有服務(如網際網路快取)進行迭代紅隊測試。
- 通訊限制: 高頻寬跨樣本通訊應限制在核准路徑(例如多代理工具)內,以關閉可發現的基礎設施側通道。
- 不可變日誌: 所有 RL 訓練、評估與內部部署日誌必須儲存在只能寫入一次的儲存空間中,以確保事故調查的可靠性並防止編輯。
監控
即時監控系統旨在快速捕捉對齊偏差行為:
- 可監控性: 模型必須保持可監控,並設有明確的監控逃避評估門檻。
- 高召回率: 監控系統必須在過去事件上展現高召回率,使用保留評估資料進行驗證。
- 評估新鮮度: 每次執行都必須建立新的評估資料點,以確保監控的精確度與召回率不會過時。
- 快速回應: 重要警示必須在定義的 SLA 內觸發行動,例如通知在班人員或自動暫停執行。
安全案例的操作指南
OpenAI 列出操作最佳實務,確保安全案例受到嚴格審查與執行:
- 治理與核准: 安全案例需經高階領導層審查並具否決權,包括研究組織負責人/副總裁、安全主管與首席科學家。負責執行的高階主管需在績效評估中對安全案例與事故回應負責。
- 風險緩解與控制:
- 異議意見(事前檢討): 外部團隊成員必須撰寫異議意見,以識別安全案例中的漏洞。
- 技術控制: 系統應設計為「預設封閉」,使非合規執行難以啟動或從訓練過程中停用監控。
- 暫停與回滾: 必須有明確的執行手冊與 SLA 用於暫停執行,並維持識別與消除對齊偏差輸出(例如資料生成)影響的能力。
- 透明度與審計: 安全案例應提供給內部監督團體(如安全與保安委員會),審計人員必須有足夠存取權以驗證主張。
- 上報機制: 必須建立對齊偏差嚴重程度的明確流程,並具備可通知高階主管(包括執行長)的在班系統,以應對高嚴重性事件。
- 殘留風險: 安全案例必須明確列出所有未被現有緩解措施涵蓋的殘留風險,以協助風險接受決策。
對對齊偏差事件的調查
發生嚴重對齊偏差事件後,OpenAI 建議進行嚴謹的調查流程,以防止再發生:
- 根本原因分析: 研究人員應使用目標性消融或重採樣實驗,理解引入對齊偏差行為的訓練動態。
- 事後檢討: 進行運作與文化層面的事後檢討,以釐清問題為何未被偵測或未被上報。
- 偵測改善: 應開發新的對齊測試方法,以發現事件的傾向,而無需針對事件特定資料進行爬升優化。事件衍生的評估可作為「回歸測試」。
- 透明度: 調查應提供定期內部更新,並以公開披露結果、事後檢討與運作變更作結,同時立即通知受影響的第三方。
"安全案例是確保前沿 AI 訓練可持續、可控制的關鍵。我們必須在技術與治理上雙管齊下,才能應對突現風險。" — @OpenAI