OpenAI 零数据保留与 Private Safety Processing

OpenAI 宣布推出 Private Safety Processing,这是一个旨在识别跨多次交互的安全风险和滥用模式的新系统,同时履行零数据保留 (Zero Data Retention, ZDR) 的承诺。这使得符合条件的 API 客户可以确保其提示词 (prompts) 和模型响应不会被 OpenAI 人员保留或审查,同时仍能实现自动化的安全执行。

零数据保留 (ZDR) 框架

零数据保留为符合条件的 API 客户提供保证,即 OpenAI 在请求处理完成后不会保留提示词或模型响应。在此框架下,客户内容无法被 OpenAI 人员审查,且除非客户明确选择加入 (opt in),否则企业数据不会被用于模型训练。

安全系统演进的需求

传统的兼容 ZDR 的安全系统是基于单个交互进行评估的。然而,OpenAI 表示,最严重的人工智能安全风险通常只有在将多次交互放在一起观察时才会显现。这些风险的示例包括:

  • 基于模式的滥用: 恶意行为者探测防护措施或跨账户进行协调。
  • 智能体失调 (Agentic misalignment): 在执行复杂、多步骤任务时,系统在收到停止指令后仍继续行动。
  • 伪装威胁: 恶意意图被伪装成常规研究。

随着 AI 模型处理的任务变得越来越长且越来越复杂,要区分合法活动与滥用行为,需要比单个交互所能提供的更广泛的上下文信息。

Private Safety Processing 的技术实现

Private Safety Processing 将自动化保护扩展到相关的交互中,以识别滥用模式,而无需向 OpenAI 人员暴露内容。该系统在两种主要的架构模型下运行:

  1. 客户控制的基础设施: 内容保留在由客户管理的基础设施上。
  2. OpenAI 提供的存储: 内容存储在 OpenAI 的基础设施上,但使用由客户独家控制的密钥进行加密。OpenAI 人员不持有这些密钥,因此无法访问底层内容。

当自动化系统识别出风险时,它会生成一个定义明确的信号,指示活动的类型。该信号用于确定是否需要执行安全措施,但即使在内容被标记时,OpenAI 人员也不会获得访问客户内容的权限。

客户控制与执行

客户对其数据和警报调查保持完全控制。如果客户希望对执行决策提出申诉、澄清合法活动或支持对已验证滥用的调查,他们可以选择自愿与 OpenAI 分享相关信息。

可用性与路线图

Private Safety Processing 目前正在与早期客户进行测试。OpenAI 计划在 2026 年 9 月开始推出该功能,并发布技术白皮书。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch