OpenAI 為網路關鍵能力開發之模型節奏調整
OpenAI 已暫時放緩模型規模擴張的速度,並暫停了特定的強化學習 (RL) 訓練運行,以實施更嚴格的安全與對齊防護措施。此決定是在 OpenAI-Hugging Face 安全事件發生後,以及初步證據顯示即將推出的 Astra 模型可能達到 OpenAI《準備就緒框架》(Preparedness Framework) 中定義的「關鍵網路安全能力」門檻後所做出的。
加強研究環境安全性
OpenAI 正提高訓練與評估環境的安全標準,以防止未經授權的存取,並防範具有先進網路安全能力的模型。繼 OpenAI-Hugging Face 事件之後,實驗室已暫停研究集群中任何能夠執行程式碼或存取網路的前沿模型推論運行。
為了建立深度防禦,OpenAI 已實施以下控制措施:
- 工作負載隔離: 現在要求對於執行模型生成或不可信程式碼的工作負載,以及處理模型輸出的軟體,必須使用更強大的「沙盒」(sandboxes)。
- 網路隔離: 新的控制措施將高風險工作負載與網際網路隔離,以確保單一服務遭到入侵時,不會授予對內部網路或網路的未經授權存取權。
- 持續安全測試: OpenAI 已移除易受攻擊的共享服務、減少常駐權限,並改進了安全日誌監控。實驗室也正在使用其自身的模型,透過模擬攻擊來自動化對這些邊界的持續測試。
這些最嚴格的防護措施目前強制要求用於所有與網路相關的工作負載,以及涉及 Astra 模型的任務。許多 Astra 工作負載在遷移至這些增強型環境之前仍保持暫停狀態。
多階段思維鏈監控
OpenAI 已擴展其監控系統,以即時偵測令人擔憂的模型行為,特別是針對前沿 RL 訓練與評估等高風險工作負載。
新的監控架構分階段運作:
- 啟動分類器 (Activation Classifiers): 這些偵測器會在每個採樣的 token 時檢查模型的內部活動。
- 自動化調查員 (Automated Investigators): 潛在的疑慮會被呈報給高運算能力的調查員,這些調查員會分析工具動作、推理過程以及活動序列,以尋找數據竊取、破壞性行為、未經授權的存取或試圖規避防護措施的跡象。
OpenAI 目標是在偵測到令人擔憂的活動後 30 分鐘內發出警報。如果懷疑發生了關鍵安全邊界違規,且在 30 分鐘內未被證明為誤報,則安全、安全與研究團隊必須暫停該活動。此監控對於所有「Sol capability」或更高能力的 RL 訓練與評估是強制性的,且自 8 月 7 日起,所有涉及工具的 Astra 推論均須遵守此規定。
運算開銷 (Compute Overhead): 此監控系統目前約需要被監控推論運算的 20%。
推進對齊與風險緩解
為了對抗獎勵駭客 (reward hacking)、欺騙與未經授權的存取等風險,OpenAI 正在其最強大模型的訓練過程中,於更多階段整合核心對齊技術。
關鍵關注領域包括:
- 獎勵模型改進: 增強獎勵模型,以在各種環境中更好地偵測並遏制不安全行為。
- 誠實訓練: 訓練模型對其行為、能力與限制更加透明。
- 減少利用行為 (Exploit Reduction): 減少利用工具、評分者、獎勵或人類監督弱點的行為。
- 擴大覆蓋範圍: 增加訓練覆蓋範圍,以應對模型與外部資源互動時可能造成傷害的行為。
《準備就緒框架》的未來演進
OpenAI 意圖演進其《準備就緒框架》,將這些防護措施整合到訓練與部署的兩個階段。實驗室計畫投資於模型輔助的安全技術,並與外部組織分享其發現。預計將在未來幾週內發布一份詳細說明這些學習成果的技術報告。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch