OpenAI 关于语言模型安全与滥用的经验教训

OpenAI 确定,AI 系统的实际部署提供了通过孤立研究无法获得的关键安全和滥用见解。主要收获是,基于 API 的滥用往往以不同于最初理论担忧的形式表现出来,并且基本的安全研究——例如对齐——直接提升了 AI 系统的商业价值。

用于风险缓解的迭代部署策略

OpenAI 采用持续迭代的部署方式,以在降低风险的同时最大化收益,因为负责任的部署没有单一的“银弹”。此策略侧重于在扩大到更大人群之前,先在小规模中学习。

此部署生命周期的关键组成部分包括:

  • 部署前分析: 使用红队工具和安全评估(例如,检查 InstructGPT 是否存在安全退化)。
  • 逐步推出: 从 GPT-3 和 InstructGPT 系列等模型的私有测试开始,以限制初始用户群。
  • 试点研究: 与少数客户一起测试新颖用例,例如长文本内容生成,以确定安全条件。
  • 使用监控: 实施 token 配额、速率限制和用例审查,以保持对模型使用方式的可见性。
  • 回顾性审查: 对主要部署和安全事件进行详细分析。

为了进一步降低危害,OpenAI 在开发管道中集成了多种干预措施,包括预训练数据筛选、为遵循指令进行微调以及创建工具来筛选有害输出。

语言模型滥用的模式

虽然 OpenAI 最初主要关注影响操作和生成误导性政治内容或恶意软件等高层次风险,但实际数据显示滥用形式更为广泛。

OpenAI 已检测并阻止了数百名试图将 GPT-3 用于未预料到或比预期更普遍目的的行为者。"野外"滥用的例子包括:

  • 对可疑医疗产品的垃圾促销。
  • 种族主义幻想的角色扮演。

值得注意的是,OpenAI 发现将输出长度限制——最初旨在遏制长文本影响操作——对政策违规几乎没有影响。该组织现在认为,旨在放大误导信息的短文本可能比长文本构成更大的风险。

风险与影响测量的挑战

现有的学术基准往往无法反映在生产环境中遇到的安全和滥用风险。OpenAI 发现学术数据集存在几个局限性,例如过于狭窄的关注点(仅测量职业性别偏差)、未能测量 AI 使用的生成维度,以及与实际使用案例在风格上不同的提示。

为了弥补这些差距,OpenAI 正在开发:

  • 新评估指标: 专门用于测量模型输出中的毒性。
  • 内部分类器: 用于检测违反仇恨言论、暴力、骚扰、自残和色情内容政策的内容。

这些分类器既用于过滤预训练数据,也用于测量数据集干预的效果。此外,OpenAI 正在研究其模型的经济影响,指出在文案撰写和摘要方面有显著的生产力提升,尽管对劳动力市场的净影响仍不清楚。

安全与商业价值的协同效应

安全研究常常直接带来商业利益,从而在对齐与实用之间产生协同效应。

这种协同效应的证据包括:

  • InstructGPT 偏好: 开发者普遍更倾向于使用 InstructGPT 模型而非基础 GPT- GPT-3,因为它们经过微调以遵循用户意图,因为它们经过微调以遵循用户意图进行微调的,且不太可能产生有害或错误的输出。这一对齐工作最初出于长期安全目标,而非商业动机。
  • 减少摩擦: 对齐后的模型降低了对复杂 "提示工程" 的需求,从而节省了模型上下文窗口的空间。
  • 真实性: 研究从互联网检索信息以更真实地回答问题,既提升了安全性也提升了产品对用户的价值。
  • 运营收益: 为防止垃圾信息而设计的速率限制也帮助客户管理他们的开支。

尽管存在这些协同效应,OpenAI 承认安全与实用有时会权衡;例如,更强大的系统需要更长的评估期,这可能会延迟盈利机会。

外部合作与研究

OpenAI 强调,没有单一组织拥有所有 AI 安全的答案。为了改善生态系统,他们实施了以下举措:

  • API 访问: 取消 API 等待名单,让更多个人能够与并理解最先进的系统进行互动。
  • 补贴积分: 向专注于偏见和滥用的外部研究者提供 API 积分。
  • 劳动力市场研究: 发布关于 Codex 模型族经济影响的研究议程,并呼吁外部合作者研究这些影响。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch