OpenAI 與美國 CAISI 及英國 AISI 的安全合作

OpenAI 已與美國人工智慧標準與創新中心(CAISI)以及英國人工智慧安全研究所(UK AISI)建立自願性合作夥伴關係,以提升前沿 AI 系統的安全性。此類合作聚焦於共同的紅隊測試、端對端產品測試,以及建立快速回饋迴路,以解決代理式 AI 與生物安全防護措施中的漏洞。

與美國 CAISI 共同確保代理式 AI 系統的安全

OpenAI 與 CAISI 合作,評估代理式 AI 系統的安全性,特別聚焦於 ChatGPT Agent 產品。此合作召集了跨領域的資安與 AI 代理安全專家團隊,並授予他們系統架構的早期存取權,以識別漏洞。

發現複雜的利用鏈

CAISI 在 ChatGPT Agent 中發現了兩項新型安全漏洞。雖然起初看似無法被利用,CAISI 發現將這些傳統軟體漏洞與 AI 代理劫持攻擊結合,可繞過基於 AI 的安全防護。最終形成完整的利用鏈,成功率約為 50%。

若攻擊成功,可能讓高度熟練的攻擊者:

  • 遠端控制在會話期間被代理存取的電腦系統。
  • 冒充使用者於其他已登入的網站上行事。

OpenAI 表示,這些漏洞在收到回報後的工作日內即已修復。

與英國 AISI 共同加強生物安全防護措施

5 月份,英國人工智慧安全研究所(UK AISI)開始對 OpenAI 的防護措施進行針對生物濫用的紅隊測試,涵蓋 GPT-5 與 ChatGPT Agent。此為持續性的合作,旨在不斷改進防護堆疊,而非僅限於單次發布。

深入系統存取以進行嚴謹測試

為了促進完整的評估,UK AISI 獲得了高階存取權限,能使用非公開資源,包括:

  • 防護系統的非公開原型。
  • 移除防護欄位的「僅協助」模型變體。
  • 關於生物濫用的內部政策指引。
  • 內部安全監控模型的思考鏈(CoT)存取。
  • 在測試期間可選擇性停用緩解措施與執行機制的能力。

結果與迭代改進

UK AISI 發現超過十項詳細的漏洞報告。這些發現促成了多種改進:

  • 工程修補: 依據漏洞報告直接修正產品。
  • 政策執行: 政策執行的實作修補。
  • 政策訓練: 針對性訓練以提升分類器。
  • 監控韌性: 改善監控堆疊,以防禦 UK AISI 所識別的通用破解。
  • 設定修補: 解決設定漏洞,防止惡意內容在未觸發審核的情況下被外洩或輸入。

UK AISI 結論認為,完整審核系統的防護已大幅加強。至迭代期結束時,製造通用攻擊需要高度複雜的技術且會產生大量審核旗標,意味著惡意行為者很可能被標記並封禁。

公私安全合作的策略意涵

這些合作展示了一個將政府國家安全專長與私營 AI 開發深度結合的模式。OpenAI 指出,這些夥伴關係提供了多項關鍵益處:

  • 國家安全專業知識: 獲取政府在機器學習與計量學方面的專業知識,能識別其他單位可能忽略的問題。
  • 技術基礎: 實務經驗使政府能制定具技術基礎的最佳實踐,從而加速全產業的安全提升。
  • 問責與信任: 外部專家分析能在已部署的系統中建立信任與問責機制。
  • 持續評估: 持續的合作比一次性的部署前評估提供更大的價值。

Sources