OpenAI 網路韌性策略
OpenAI 已宣布一項全面策略,以管理進階 AI 網路安全能力的雙重使用風險。公司正在部署分層安全堆疊,並建立新的防禦工具和諮詢機構,以確保隨著模型變得更強大,它們能為網路安全防禦者提供相對於惡意行為者的顯著優勢。
AI 網路能力的快速進步
AI 模型正展示出在執行網路安全任務方面的顯著提升。OpenAI 報告指出,透過奪旗(CTF)挑戰測量的能力,從 2025 年 8 月的 GPT-5 的 27% 提升至 2025 年 11 月的 GPT-5.1-Codex-Max 的 76%。
OpenAI 現在正在為達到其「備就框架」所定義的「高」級網路安全能力的模型做準備。此級別被定義為能夠針對防禦良好的系統開發可運作的零日遠端漏洞,或為複雜、隱蔽的企業或工業入侵行動提供有意義協助的模型。
減少濫用的分層安全堆疊
因為防禦與進攻的網路工作流程經常依賴相同的基礎知識,OpenAI 正採用深度防禦方法,以限制惡意提升同時保持對防禦者的實用性。
基礎設施與監控
在基礎層,OpenAI 使用以下組合:
- 存取控制
- 基礎設施加固
- 出口控制
- 全系統監控以偵測潛在惡意活動
當偵測到不安全活動時,系統可能會封鎖輸出,將提示路由至能力較弱的模型,或根據嚴重程度和重複行為將問題升級進行人工審查。
模型訓練與紅隊演練
OpenAI 正在訓練前沿模型,使其拒絕啟用明顯網路濫用的請求,同時在教育和防禦用例中保持有幫助。為驗證這些保護措施,公司與專家紅隊組織合作,進行端到端評估,模擬決心且資源充足的對手,以識別並封堵安全漏洞。
生態系統計畫以提升防禦韌性
OpenAI 正推出數項計畫,旨在加速負責任的修復,並為防禦者提供先進工具。
Aardvark 代理安全研究員
Aardvark 是一個目前處於私人測試階段的代理安全研究員。其設計旨在透過掃描程式碼基礎並提出補丁,協助開發者和安全團隊大規模尋找並修復漏洞。Aardvark 已在開源軟體中發現了新穎的 CVE。OpenAI 計畫為選定的非商業開源儲存庫提供免費覆蓋,以保護軟體供應鏈。
可信存取與諮詢委員會
OpenAI 正在推出可信存取計畫,以提供符合資格的網路防禦使用者分層存取最新模型的增強能力。此外,公司正在成立前沿風險委員會,這是由經驗豐富的網路防禦者和安全從業者組成的諮詢團隊,將就負責任能力與潛在濫用之間的界限提供建議。
全產業合作
為應對所有前沿模型中的網路濫用風險,OpenAI 透過前沿模型論壇與其他實驗室合作。這項非營利工作專注於發展對威脅模型的共同理解,識別武器化路徑,並找出威脅行為者的關鍵瓶頸。OpenAI 也正與外部團隊合作,開發獨立的網路安全評估,以建立跨產業對模型能力的共同理解。