OpenAI 針對 AGI 開發的安全策略
OpenAI 正在部署一套全面的安全策略,結合 AI 驅動的防禦代理、持續的對抗性紅隊測試以及零信任基礎設施,以減輕隨著組織向人工通用智慧 (AGI) 前進而不斷演變的威脅。
AI 驅動的網路防禦
OpenAI 使用自家的 AI 技術來擴展網路防禦並提升威脅偵測。這些 AI 驅動的安全代理補充傳統的事件回應策略,提供精確且可行的情報,並使對複雜對手手法的快速回應成為可能。
持續的對抗性紅隊測試
為了主動識別漏洞,OpenAI 與安全研究專家 SpecterOps 合作,在企業、雲端與生產環境中執行逼真的模擬攻擊。此合作的重點包括:
- 嚴謹測試安全防禦,以加強回應策略。
- 產生進階技能訓練,以提升模型在保護產品與模型方面的能力。
威脅行為者的阻斷與產業合作
OpenAI 監控並阻斷惡意行為者利用其技術的企圖。當特定威脅被識別時——例如針對員工的魚叉式網釣活動——OpenAI 會將相關的作業手法分享給其他 AI 實驗室、產業夥伴與政府機構,以加強對新興風險的集體防禦。
確保 AI 代理與自主系統的安全
隨著像 Operator 這樣的先進代理與深度研究的推出,OpenAI 正在應對與代理式 AI 相關的獨特安全挑戰。主要的緩解措施包括:
- 對齊方法: 開發強韌的方式以防禦提示注入攻擊。
- 基礎設施與監控: 加強底層安全,實施監控控制以偵測並緩解非預期或有害的行為。
- 統一管線: 建構模組化框架,提供可擴展、即時的可見性與執行,涵蓋各種代理行動與形態。
未來大型計畫的安全
針對如 Stargate 等次世代專案,OpenAI 正透過多項業界領先的做法,將安全性納入基礎設計:
- 架構安全: 採用零信任架構與硬體支援的安全解決方案。
- 實體防護: 隨著實體基礎設施擴展,實施先進的存取控制、全面監控與加密保護。
- 供應鏈安全: 專注於軟硬體供應鏈的安全,以確保深層防禦。
Sources
- OriginalSecurity on the path to AGI