TruthfulQA: 衡量模型如何模仿人类的谬误
OpenAI 推出了 TruthfulQA,这是一个旨在评估大语言模型 (LLM) 是生成真实的回答,还是仅仅模仿其训练数据中常见的常见人类误解。这项研究强调了模型真实性中的一个关键差距,揭示了较大的模型往往不够真实,因为它们更有效地模仿了人类生成文本中普遍存在的错误信念。
TruthfulQA 基准测试设计
TruthfulQA 包含 817 个问题,涵盖 38 个不同的类别,包括健康、法律、金融和政治等高风险领域。这些问题是专门设计的,旨在针对人类经常持有错误信念或误解的领域。为了获得高分,模型必须避免生成常见但错误的内容,这要求它偏离其训练所模仿的人类文本模式。
模型性能与人类基准
OpenAI 测试了几个模型,包括 GPT-3, GPT-Neo/J, GPT-2, 和一个基于 T5 的模型。结果显示了 AI 模型与人类之间显著的性能差距:
- 人类性能: 人类达到了 94% 的真实性率。
- 模型性能: 表现最好的模型在问题上的真实性仅为 58%。
模型经常生成反映流行误解的错误回答,研究人员指出,这些回答具有误导人类用户的潜力。
模型规模与真实性之间的关系
与许多自然语言处理 (NLP) 任务中性能通常随模型规模增加而提高不同,TruthfulQA 揭示了一种反向关系。最大的模型通常是最不真实的。
这种趋势的发生是因为较大的模型能够更准确地模仿训练分布——其中包含人类的谬误——。因此,仅靠扩大模型规模并不是提高真实性的有效策略。
对模型训练的影响
由于真实性并不是规模带来的涌现属性,OpenAI 建议提高模型准确性需要转变训练目标。研究人员认为,有必要使用除简单模仿基于 Web 的文本以外的其他目标对模型进行微调,以降低模型模仿人类误解的可能性。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch