ChatGPT 如何学习并保护用户隐私

ChatGPT 如何学习并保护用户隐私

OpenAI 结合公共数据、合作伙伴关系和用户生成内容来训练 ChatGPT,使用 OpenAI 隐私过滤器对个人信息进行掩码,并为用户提供细粒度的控制,以选择退出模型改进。

模型训练的数据来源

ChatGPT 在多样化的信息来源上进行训练,以构建通用的世界知识并提升可靠性和安全性。这些来源包括:

  • 公开可用信息: OpenAI 使用在互联网上自由且公开获取的内容,例如公开的博客文章和在线讨论论坛。
  • 合作伙伴关系: 通过战略合作伙伴获取的数据。
  • 用户和研究者贡献: 由用户、承包商和研究者提供或生成的信息。

通过 OpenAI 隐私过滤器减少个人信息

为了防止模型学习个人的私人信息,OpenAI 在训练前对数据集应用保护措施。此过程的主要工具是 OpenAI 隐私过滤器,它能够识别并掩码文本中的个人信息。

OpenAI 表示,内部评估显示隐私过滤器在删除个人信息方面比任何其他类似工具更为有效。该过滤器在训练流水线的多个阶段集成,适用于公共数据集和用户对话(前提是用户已启用 “Improve the model for everyone” 设置)。

ChatGPT 中的用户隐私控制

OpenAI 提供了多种机制,让用户控制其数据的处理方式以及是否用于未来的模型迭代:

模型训练退出选项

用户可以在 Settings > Data Controls 中关闭 “Improve the model for everyone” 设置。关闭此设置后,新对话仍会保存到聊天记录,但不会用于训练 ChatGPT。

临时聊天

临时聊天提供基于会话的隐私模式。这些对话:

  • 不会出现在聊天记录中。
  • 不会创建记忆。
  • 不会用于改进 OpenAI 模型。
  • 为安全目的保留 30 天后删除。

记忆管理

记忆功能允许 ChatGPT 在会话之间记住特定细节。这完全是可选的;用户可以查看、编辑或删除特定记忆,或完全禁用该功能,以防止 ChatGPT 保存或引用过去的交互。

账户和数据管理

用户可以使用隐私请求门户提交隐私请求、导出其 ChatGPT 数据或完全删除账户。OpenAI 建议用户不要在 ChatGPT 中分享他们不希望被审查或使用的敏感信息。

平衡隐私与安全

OpenAI 坚持认为,保护隐私和应对伤害风险必须同步进行。公司持续开发系统,以检测和应对可信的暴力威胁,同时保持现有的隐私保护措施。随着模型能力的提升,OpenAI 承诺改进防护措施,并提供更清晰、更实用的方式,让用户决定其信息的使用方式。

Sources