GPT-2 六个月跟进
OpenAI 在经历了从 2019 年 2 月发布 124M 模型、2019 年 5 月发布 355M 模型的分阶段发布流程后,发布了 GPT-2 的 7.74 亿参数版本。此次发布是更广泛努力的一部分,旨在平衡开放研究的收益与滥用风险,例如生成令人信服的合成虚假信息。
模型发布与滥用的关键经验
OpenAI 在 GPT-2 上的经验凸显了大规模生成模型部署中的三个主要挑战:
1. 协调的困难
虽然多个组织具备训练 15 亿参数或更多模型的能力,但此类模型的公开发布仍然有限。OpenAI 指出,由于这些系统的专有性质以及缺乏清晰的跨组织沟通渠道,组织之间在发布规范方面的协调非常困难。
2. 人类对合成文本的易感性
合成文本日益具备欺骗人类的能力。康奈尔大学的研究表明,测试队列中有 72% 的人认为 GPT-2 生成的合成文本样本具有可信度,而真实《纽约时报》文章的这一比例为 83%。此外,Allen Institute for AI(AI2)和华盛顿大学的研究发现,“GROVER”系统能够生成比人类撰写的宣传更具可信度的新闻。
3. 文本检测的复杂性
检测 AI 生成的文本是一项重大技术挑战。为了在实际场景中有效,检测器必须达到 99.9% 至 99.99% 的准确率,并且误报极少。当前基于机器学习的方法通常只能达到低到中 90 %的准确率,且在模型微调后准确率会进一步下降。OpenAI 得出结论,统计检测必须结合人工判断和元数据,才能有效应对滥用。
研究合作与安全分析
为了为潜在发布完整规模的 1558M 参数模型提供依据,OpenAI 与四家研究机构合作,分析了 774M 和 1558M 模型:
- Cornell University:研究人类对数字虚假信息的易感性。
- The Middlebury Institute of International Studies (CTEC): 探索恐怖分子和极端分子可能的滥用途径。
- The University of Oregon:开发 "bias probes" 以分析内部模型偏差。
- The University of Texas at Austin:研究在特定领域微调后输出的统计可检测性以及跨模型的检测迁移。
未来发布策略
OpenAI 当前的计划是在几个月后发布 1558M 参数模型,尽管此时间表仍取决于研究伙伴的发现以及 774M 模型的实际使用情况。OpenAI 主张采用分阶段发布和基于合作的模型共享相结合的方式,作为负责任 AI 发布的基础,特别是随着强大生成模型固有挑战预计将随时间增长。
Sources
- OriginalGPT-2: 6-month follow-up