OpenAI AI 文本分类器发布(2023 年 1 月)
TL;DR
OpenAI 于 2023 年 1 月 31 日推出了免费、公开可用的 AI 文本分类器,以帮助检测 AI 编写的英文内容,但该工具受限:它仅能正确标记 26% 的 AI 生成文本,并对人类文本产生 9% 的误报率,随后因准确率低而被撤下。
分类器的功能
该分类器是一个微调的语言模型,用于区分人类撰写和 AI 撰写的段落。它在配对数据集上进行训练,数据集包含相同提示由人类和来自 OpenAI 以及其他供应商的多种语言模型给出的回答。对于网页演示,OpenAI 设置了较高的置信阈值以保持误报率低,仅在模型非常确定时才将文本标记为“可能是 AI 撰写”。
报告的性能
- 真实阳性率:在英文 AI 生成文本的挑战集上为 26%。
- 误报率:9% 的人类撰写文本被错误标记为 AI 撰写。
- 长度依赖性:输入越长准确率越高;在少于 1,000 字符的文本上分类器尤为不可靠。
- 与先前工作比较:新模型的可靠性显著高于 OpenAI 早前随 GPT‑2 输出数据集发布的检测器。
关键限制
- 不是决策工具:分类器只能作为补充信号使用,而非最终判决。
- 短文本弱点:少于 1,000 字符的输入会产生高度不可靠的预测。
- 语言与领域范围:仅针对英文校准,对其他语言和代码的表现很差。
- 可预测内容:确定性文本(例如素数列表)无法被区分。
- 对抗性编辑:人工编辑可以规避检测,持续的攻击可能超前于重新训练。
- 校准问题:在训练分布之外,模型可能对错误预测过于自信。
训练数据与方法论
OpenAI 汇集了从预训练语料库和提交给 InstructGPT 的人工示例中抽取的人类撰写片段。每个片段被拆分为提示和响应。针对每个提示,使用包括 OpenAI 自有模型以及其他组织模型在内的多种语言模型生成响应。随后,分类器在这些人‑AI 对上进行微调。
预期使用场景与推广
OpenAI 强调了若干潜在应用:
- 检测伪装成人类对话的自动化错误信息宣传活动。
- 识别使用 AI 工具生成论文的学术不端行为。
- 防止 AI 聊天机器人被误认为是人类对话者。
实验室还发布了面向教育者的 ChatGPT 使用初步资源,并通过公开表单邀请教师、管理员、学生和家长提供反馈。OpenAI 强调,分类器是其开发文本、音频和视觉内容来源技术更广泛努力的一部分。
当前状态
截至 2023 年 7 月 20 日,AI 文本分类器因准确率低被下线。OpenAI 表示正在研究更有效的来源技术,并仍致力于部署帮助用户判断内容是否由 AI 生成的工具。
作者:Jan Hendrik Kirchner, Lama Ahmad, Scott Aaronson, Jan Leike