OpenAI 網路安全補助計畫:支援 AI 驅動的防禦研究
OpenAI 已啟動網路安全補助計畫,以支援賦能網路防禦者的研究與工具。該計畫聚焦於利用 AI 減輕安全威脅、保護大型語言模型(LLM),以及自動化軟體漏洞的偵測與修補。
LLM 可信度與模型安全性
對模型本身安全性的研究是補助計畫的主要焦點。關鍵專案包括:
- Prompt-Injection Defense: 加州大學伯克利分校的 Wagner 實驗室,由 David Wagner 教授領導,正在開發防禦 prompt‑injection 攻擊的技術,以提升 LLM 的整體可信度。
- Training Data Privacy: Dartmouth 大學的 Breuer 實驗室,由 Adam Breuer 教授領導,正在研究防禦技術,以防止對手透過模型互動重建私人訓練資料,目標是在不犧牲模型準確度或訓練效率的前提下達成。
- Secure Inference Infrastructure: Mithril Security 已建立概念驗證與開源工具,利用基於受信任平台模組(TPM)的安全區塊在 GPU 上部署 AI 模型。此架構旨在確保傳送至 AI 供應商的資料保持機密,即使是管理員也無法存取。
自動化漏洞偵測與修補
AI 正被應用於識別並僅修補軟體與程式碼中的安全缺陷:
- Software Misconfiguration: Coguard 正在使用 AI 自動偵測軟體設定錯誤——這是安全事件的常見原因——以 AI 驅動的自動化取代過時的規則式政策。
- Code Vulnerability Analysis: 波士頓大學安全實驗室(SeclaBU)與 Peac Lab 的研究人員,包括博士生 Saad Ullah 以及 Gianluca Stringhini 教授與 Ayse Coskun 教授,正致力於提升 LLM 偵測與修補程式碼漏洞的能力,以防止惡意利用之前的漏洞被利用。
自主防禦與紅隊測試
該計畫支援在主動防禦情境中探索基礎模型的應用:
- Autonomous Cyber Defense Agents: 聖克魯斯大學(UCSC)的 CY‑PHY 安全實驗室,由 Alvaro Cardenas 教授領導,正在設計能自主回應網路入侵者的代理人。此研究比較基礎模型與強化學習(RL)方案,以找出最佳協作方式,提升威脅分流與網路安全。
- Automated Red-Teaming: MIT 計算機科學人工智慧實驗室(MIT CSAIL)的研究人員正於計畫‑執行‑回報迴圈中使用 prompt engineering,將紅隊測試期間的決策流程與可執行回應自動化。他們亦在 Capture‑the‑Flag(CTF)挑戰中測試 LLM‑Agent 能力,以在受控環境中發掘漏洞。