GPT-2 1.5B 发布说明

OpenAI 已发布了 GPT-2 的 15 亿参数版本,这是其分阶段发布计划中的最后一个也是最大的模型。此次发布包括模型权重和代码,以促进合成文本检测工具的开发。

人类对 GPT-2 输出的感知

人类发现 1.5B 模型的输出比较小版本的模型更具说服力,尽管与 774M 模型相比,可信度的提升并不显著。在康奈尔大学进行的一项调查中,1.5B 模型获得了 6.91/10 的可信度评分,而 774M 模型为 6.72,355M 模型为 6.07。

滥用与合成宣传的潜力

GPT-2 可以通过微调来针对特定的意识形态立场生成合成宣传内容。由 Middlebury Institute of International Studies 的 Center on Terrorism, Extremism, and Counterterrorism (CTEC) 进行的研究表明,该模型可以在四种意识形态上进行微调:白人至上主义、马克思主义、圣战派伊斯兰主义和无政府主义。

合成文本检测的挑战

基于内容的合成文本检测仍然是一个长期挑战,因为更大的模型生成的输出更难分类。OpenAI 开发了一个基于 RoBERTa-BASE (125 million parameters) 和 RoBERTa-LARGE (355 million parameters) 的检测模型,对于 1.5B GPT-2 生成的文本,其检测率约为 95%。

OpenAI 指出,这种准确率不足以进行独立检测,必须结合基于元数据的方法、人类判断和公众教育。该公司还观察到,虽然在更大模型的输出上进行训练可以提高检测的鲁棒性,但随着模型规模的增长,分类的整体难度也在增加。

滥用证据

目前还没有强有力的证据表明 GPT-2 被广泛滥用。虽然对于网络钓鱼和垃圾邮件等高容量、低收益操作的潜力进行了讨论,但 OpenAI 并未发现该模型被用于编写代码、文档或其他恶意实例的证据。

偏差分析与标准

语言模型本质上包含偏差。为了解决这个问题,OpenAI 实施了两种主要策略:

  • Model Cards: 在 GitHub 上发布模型卡片以记录语言模型的固有问题。
  • 定性评估: 进行针对性别、种族和宗教偏差的内部探测,以完善模型卡片。

OpenAI 强调,这些探测并非全面,并强调需要 AI 研究社区协作制定标准化的偏差分析框架。

负责任的发布规范

GPT-2 的发布是分阶段发布过程的一个测试案例。OpenAI 正通过参与 Partnership on AI 的“Responsible Publication Norms for Machine Learning”项目,继续致力于为机器学习建立负责任的发布规范。

Sources