OpenAI Zero Data Retention 與 Private Safety Processing

OpenAI 已宣布推出 Private Safety Processing,這是一個旨在識別跨多個互動中的安全風險與濫用模式的新系統,同時維持 Zero Data Retention (ZDR) 的承諾。這讓符合條件的 API 客戶能夠確保其提示詞 (prompts) 與模型回應不會被 OpenAI 人員保留或審查,同時仍能實現自動化的安全執行。

Zero Data Retention (ZDR) 架構

Zero Data Retention 為符合條件的 API 客戶提供保證,即 OpenAI 在請求處理完畢後不會保留提示詞或模型回應。在此架構下,客戶內容無法供 OpenAI 人員審查,且除非客戶明確選擇加入 (opt in),否則企業數據不會用於模型訓練。

安全系統演進的需求

傳統與 ZDR 相容的安全系統是針對個別互動進行評估。然而,OpenAI 表示,最嚴重的 AI 安全風險通常只有在將多個互動放在一起觀察時才會顯現。這些風險的範例包括:

  • 基於模式的濫用: 惡意行為者試圖探測防護措施或跨帳號進行協作。
  • 代理式失調 (Agentic misalignment): 系統在複雜的多步驟任務中,於收到停止指令後仍繼續執行動作。
  • 偽裝威脅: 將有害意圖偽裝成常規研究。

隨著 AI 模型處理更長且更複雜的任務,要區分合法活動與濫用行為,需要比單一互動提供更廣泛的上下文資訊。

Private Safety Processing 的技術實作

Private Safety Processing 將自動化保護擴展到相關的互動中,以識別濫用模式,而不會將內容暴露給 OpenAI 人員。該系統在兩種主要的基礎設施模型下運作:

  1. 客戶控制的基礎設施: 內容保留在由客戶管理的基礎設施上。
  2. OpenAI 提供的儲存空間: 內容儲存在 OpenAI 的基礎設施上,但使用由客戶獨自控制的密鑰進行加密。OpenAI 人員並不持有這些密鑰,因此無法存取底層內容。

當自動化系統識別出風險時,它會產生一個定義狹窄的訊號,用以指示活動的類型。此訊號用於判斷是否需要執行強制措施,但即使在內容被標記時,OpenAI 人員也不會獲得客戶內容的存取權限。

客戶控制與執行

客戶對其數據與警報調查保持完全控制。如果客戶希望對執行決定提出申訴、澄清合法活動,或支持對已驗證濫用行為的調查,他們可以選擇自願與 OpenAI 分享相關資訊。

可用性與路線圖

Private Safety Processing 目前正在與早期客戶進行測試。OpenAI 計畫於 2026 年 9 月開始推出此功能,並發布技術白皮書。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch