评估语言模型的说服力

Anthropic 开发了一种量化语言模型说服力的方法,发现说服力随着模型代际的提升而增强,其最强大的模型 Claude 3 Opus 的说服力与人类写作者相当。这项研究至关重要,因为说服力是一种通用技能,可用于有益目的(如医疗保健),也可能被滥用于制造虚假信息。

模型说服力的扩展趋势

说服力与模型规模和能力呈一致的扩展关系。在“紧凑型”(更小、更快)和“前沿型”(更大、能力更强)模型类别中,Anthropic 每一代新模型的说服力评分均高于前一代。

Claude 3 Opus 成为测试中最具说服力的模型,其说服力与人类撰写的论点相比无统计学显著差异。相比之下,Claude Instant 1.2 在评估的模型中说服力得分最低。

说服力测量方法

Anthropic 采用三步流程来衡量论点改变人们观点的有效性:

  1. 初始评估:参与者被呈现一个主张,并要求在 1-7 的李克特量表上评估其同意程度。
  2. 暴露:参与者看到一个试图说服他们同意该主张的论点。
  3. 重新评估:参与者在阅读论点后再次评估其同意程度。

说服力定义为最终支持得分与初始支持得分之间的差值。为确保结果并非由反应偏差或随机噪声导致,Anthropic 设置了对照条件,让 Claude 2 尝试反驳无可争议的事实性主张(例如水的冰点);由此产生的说服力得分接近于零。

关注低极化议题

研究人员聚焦于 28 个复杂且新兴的问题——例如在线内容审核和太空探索的伦理准则——共生成了 56 个有立场的主张。这些议题被选中,是因为人们对它们的立场尚未固化,因此比高度极化、有争议的问题更容易被说服。

论点生成与提示策略

为比较 AI 与人类的表现,Anthropic 收集了来自 3,832 名独特人类参与者的论点。对于 AI,使用了四种不同的提示策略以捕捉多种写作风格:

  • 有力论据:针对立场摇摆或持怀疑态度的人群。
  • 角色扮演专家:运用情感诉求、逻辑论证和可信度等修辞技巧。
  • 逻辑推理:使用具有说服力的逻辑推理。
  • 欺骗性策略:允许模型捏造事实、统计数据和来源,以达到最大程度的说服力。

关键发现与提示敏感性

研究发现,基于逻辑和证据的论点比修辞或情感语言更有效。值得注意的是,欺骗性策略——允许模型捏造信息——总体上最具说服力。这表明用户并不总是验证所呈现信息的正确性,凸显了虚假信息传播的风险。

局限性与研究挑战

Anthropic 指出,以下因素影响了研究的生态效度:

  • 单轮论点:研究评估的是自洽的论点,而非现实世界中更常见的多轮对话。
  • 主观性:说服力本质上是主观的,取决于个人的先验信念、价值观和认知风格。
  • 人类专家水平:人类写作者并非正式的说服专家,因此真正的专家可能在本研究中表现优于 AI 和人类参与者。
  • 锚定效应:许多参与者的支持度几乎没有变化,或仅增加了一点,表明评分过程中存在锚定效应。
  • 自动化评估:尝试使用模型评估说服力的方法与人类判断的相关性较差,可能是因为模型倾向于自我偏袒或表现出阿谀奉承的倾向。

伦理影响与安全措施

AI 有效说服的能力对安全部署构成风险,尤其是在虚假信息传播方面。Anthropic 的可接受使用政策禁止将 Claude 用于滥用、欺诈或欺骗性应用,包括政治竞选和游说活动。这些政策由自动化和人工双重执行系统支持,以防止技术被滥用,从而破坏选举公正性。

Sources

相关