OpenAI 被指控利用用户对话进行训练以宣称技术突破

OpenAI 面临利用用户对话实现突破的指控

研究人员指责 OpenAI 利用用户的私人对话作为训练数据来实现技术突破,然后将这些结果作为原创发现进行展示。争议的焦点在于,OpenAI 可能从与模型互动的学术研究人员那里“窃取”了证明或解决方案,实际上是利用用户的知识产权来宣称突破。

用户退出机制与数据泄露之间的冲突

争论的核心点在于,用户是否应该负责主动退出训练,还是 AI 实验室在防止训练集中出现数据泄露方面负有道德和技术义务。

“退出机制”论点

一些观察者认为,用户应对自己的数据安全负责。在 ChatGPT 中,“Improve the model for everyone”设置是默认启用的,这允许 OpenAI 使用内容进行训练。研究人员的批评者认为,如果用户没有明确退出此设置,他们实际上就已经同意其数据被用于训练。

“泄露”论点

其他专家认为,举证责任应落在 AI 实验室身上。他们主张,OpenAI 在宣称实现突破之前,应当积极检查是否存在数据泄露——即特定的、独特的解决方案或证明被模型记忆并重新输出的情况。

"OpenAI 在面对这类重大突破时,可以且应当检查其训练数据是否存在泄露。作者有责任适当地引用其来源。"

利用用户数据进行训练的技术细节

并非所有使用用户数据的方式在风险方面都是对等的。前 OpenAI 研究人员 John Schulman 强调了“在对话中进行训练”的不同程度,每种程度的重新输出风险各不相同:

  • Pretraining on user data: 使用用户 token 作为预测目标。这具有很高的原始文本重新输出(记忆)风险。
  • Distillation: 使用用户提示词将大模型蒸馏为小模型。这具有较低的重新输出风险。
  • RL (Reinforcement Learning) Tasks: 使用用户轨迹来构建 RL 任务。这通常具有较低的记忆能力,但根据实现方式的不同,仍可能提取客户的 IP。

AI 用户操作安全 (OpSec) 建议

鉴于数据处理方式缺乏透明度,技术用户和研究人员建议采取几种“常识性 OpSec”措施来保护知识产权:

  1. Explicit Opt-Out: 在账户数据控制中手动禁用训练设置。
  2. Avoid Feedback Buttons: 使用“点赞/点踩”反馈按钮通常会触发对整个对话的收集和保留,以用于训练目的。
  3. Use Temporary Chats: 利用 ChatGPT 和 Claude 中提供的“隐身”或临时聊天模式,这些模式旨在被排除在训练之外。
  4. Be Wary of Safety Classifiers: 一些提供商(例如 Anthropic)可能会保留并对触发了安全分类器的对话进行训练,即使由于用户已退出了通用训练。

提出的透明度解决方案

为了解决这些争议,一些社区成员建议采用标准化的去污染方法。一项提案是使用“canary GUIDs”(类似于 BIG-bench 中使用的那些)并公开披露 n-gram 阈值(例如 GPT-3 使用的 13-gram 阈值),以证明模型没有记忆特定的训练样本。

Sources

相关