OpenAI GPT-2 发布及其影响

OpenAI 开发了 GPT-2,这是一种大规模无监督语言模型,能够生成连贯的文本段落,并在多个语言建模基准测试中实现了最先进的性能。该模型展示了在没有任何特定任务训练的情况下,执行初步阅读理解、机器翻译、问答和摘要生成的能力。

技术架构与训练

GPT-2 是原始 GPT 模型的直接规模扩展,其参数量增加了 10 倍以上,训练数据量也增加了 10 倍以上。

  • 模型规模: 完整模型包含 15 亿个参数。
  • 训练目标: 该模型的训练目标非常简单,即在给定文本中所有先前单词的情况下预测下一个单词。
  • 训练数据: GPT-2 是在 800 万个网页(约 40GB 的互联网文本)的数据集上训练的,这些数据是通过 Reddit 的出站链接筛选的,且每个链接至少获得 3 个 karma 以确保多样性和质量。
  • 架构: 它基于 transformer 架构。

零样本能力与性能

GPT-2 在“零样本”(zero-shot)设置下,在各种特定领域的语言建模任务中实现了最先进的分数,这意味着它没有针对这些任务的特定数据进行训练,仅作为最终测试进行评估。

语言建模基准测试

GPT-2 在以下基准测试中表现优于在 Wikipedia、新闻或书籍等特定领域数据集上训练的模型:

Dataset Metric GPT-2 Result Previous Record Human
Winograd Schema Challenge Accuracy (+) 70.70% 63.7% 92%+
LAMBADA Accuracy (+) 63.24% 59.23% 95%+
Children’s Book Test (Common Nouns) Accuracy (+) 93.30% 85.7% 96%
Children’s Book Test (Named Entities) Accuracy (+) 89.05% 82.3% 92%
Penn Tree Bank Perplexity (–) 35.76 46.54 unknown
WikiText-2 Perplexity (–) 18.34 39.14 unknown
enwik8 Bits per character (–) 0.93 0.99 unknown
text8 Bits per character (–) 0.98 1.08 unknown
WikiText-103 Perplexity (–) 18.34 18.3 unknown

通用语言任务

虽然没有达到专门化系统的最先进水平,但 GPT-2 可以通过对训练好的模型进行特定提示(prompting)来执行阅读理解、摘要生成和翻译等任务,而无需任何微调(fine-tuning)。

文本生成与失败模式

GPT-2 可以根据任意输入提示生成逼真的且连贯的文本续写。然而,该模型表现出几种失败模式:

  • 重复文本: 模型可能会产生重复的序列。
  • 世界建模失败: 模型偶尔会生成逻辑上不可能的场景(例如,描述火灾发生在水下)。
  • 不自然的题目切换: 模型可能会突然切换话题。

OpenAI 指出,性能因话题而异;模型在训练数据中高度代表性的主题(例如,Brexit、Lord of the Rings)上表现更成功,而在高度技术性或冷门的内容上表现较差。

政策影响与滥用风险

OpenAI 识别了大型语言模型可能存在的几种潜在益处与恶意用途:

潜在益处

  • AI 写作助手
  • 能够进行对话的智能体
  • 语言间的无监督翻译
  • 更好的语音识别系统

潜在恶意用途

  • 生成误导性新闻文章
  • 网络身份冒充
  • 自动化内容生产: 为社交媒体自动生产辱骂性、虚假或垃圾邮件/网络钓鱼内容。

OpenAI 警告说,这些技术降低了生成虚假内容和进行虚假信息传播运动的成本,因此建议公众必须对在线文本变得更加怀疑。

发布策略:分阶段披露

由于担心大规模生成具有欺骗性或滥用性的语言的可能性,OpenAI 通过分阶段发布实施了一项负责任的披露实验:

  1. 初始发布: 最初仅发布了规模小得多的 GPT-2 版本(117M 参数)和采样代码。
  • 中期更新(2019 年 5 月): 发布了参数量更大的 345M 版本。
  • 合作伙伴共享: 762M 和 1.5B 版本仅与 AI 和安全社区的合作伙伴共享,以提高社会的准备程度。

OpenAI 没有向公众发布完整的数据集、训练代码或 1.5B 模型权重。这一策略旨在为社区提供时间来评估模型的特性并评估每个发布阶段的影响。

Sources