Anthropic 选举完整性测试与缓解框架

Anthropic 开发了一套灵活且迭代的过程,用于识别并缓解其 AI 模型中与选举相关的风险。通过将深入的专家测试与大规模自动化评估相结合,该公司旨在防止不准确选举信息的传播,并阻止其模型被用于违反政策的行为,例如虚假信息活动。

选举安全的多层方法

Anthropic 采用了系统安全的“瑞士奶酪模型”,利用分层且重叠的干预措施,以确保不会因单一故障点而损害选举完整性。该过程由四个主要阶段组成:政策漏洞测试、自动化评估、缓解策略的实施以及有效性重测。

政策漏洞测试 (PVT)

政策漏洞测试是一个定性的、深入的测试阶段,由外部领域专家进行,包括来自 Institute for Strategic Dialogue 的研究人员。PVT 侧重于两个主要风险:用户接收到有害或不准确的信息,以及用户违反使用政策。

PVT 过程遵循三个阶段:

  1. 规划:选择政策领域,例如选举管理、政治平等以及恶意行为者的潜在滥用。
  2. 测试:专家构建非对抗性和对抗性提示词,以记录模型输出并根据政策进行基准测试。
  3. 审查:通过协作会议识别安全系统的差距并确定修复的优先级。

可扩展的自动化评估

为了提供人工测试无法实现的广度,Anthropic 使用了自动化评估。这些评估是通过使用语言模型,基于专家编写的 PVT 问题,采用 few-shot prompting 方法生成数百个测试问题而开发的。

自动化评估允许实现:

  • 可扩展性:在几分钟内对多个模型变体进行数百个提示词的测试。
  • 全面性:通过大型且有针对性的评估集来评估更广泛的场景。
  • 一致性:通过在不同模型上应用一致的问题集来减少变异性。

为了确保质量,Anthropic 会手动审查这些生成问题的样本。在一次案例中,对 700 个关于欧盟选举管理问题中的 64 个问题进行审查发现,模型生成的 89% 的问题都是 PVT 工作的相关扩展。

风险缓解策略

来自 PVT 和自动化评估的结果促成了几项具体的的技术和政策干预措施:

  • 系统提示词更新:在系统提示词中添加上下文,例如模型的知识截止日期,以帮助用户了解所提供信息的时效性。
  • 模型微调:使用特定的训练数据来激励期望的行为。例如,Anthropic 为模型创建了一种“奖励”,使其引导用户参考权威来源。
  • 政策细化:更新使用政策,明确禁止生成虚假信息、干预选举过程或支持特定的政治候选人或政党。
  • 执行工具:利用经过微调的 Claude 版本来实时评估提示词和补全内容,并辅以人工审计以及对违反政策的用户进行停用处理。
  • 直接用户重定向:实施 UI 元素,例如在 claude.ai 上显示弹出横幅,将美国用户重定向至 TurboVote,并将欧盟用户重定向至欧洲议会指南。

通过案例研究衡量有效性

Anthropic 使用其测试框架,在干预措施实施后重新运行相同的协议,以验证缓解措施是否真正有效。

知识截止日期引用

为了确保模型在处理时间敏感的选举查询时引用其知识截止日期(2023 年 8 月),Anthropic 更新了系统提示词。通过对比 Claude 2、Claude 3 Opus 的研究版本(不含提示词)和公开版的 Claude 3 Opus(含提示词),Anthropic 观察到这一优先缓解措施带来了 47.2% 的提升。

权威来源推荐

为了提高向权威来源推荐的频率,Anthropic 采用了模型微调。对比 Claude 2(未针对此行为进行微调)和 Claude 3 Opus(经过微调)的结果显示,在适当的情况下,模型引导用户参考可靠来源的频率提高了 10.4%。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch