Anthropic 选举完整性测试与缓解框架
Anthropic 开发了一套灵活且迭代的过程,用于识别并缓解其 AI 模型中与选举相关的风险。通过将深入的专家测试与大规模自动化评估相结合,该公司旨在防止不准确选举信息的传播,并阻止其模型被用于违反政策的行为,例如虚假信息活动。
选举安全的多层方法
Anthropic 采用了系统安全的“瑞士奶酪模型”,利用分层且重叠的干预措施,以确保不会因单一故障点而损害选举完整性。该过程由四个主要阶段组成:政策漏洞测试、自动化评估、缓解策略的实施以及有效性重测。
政策漏洞测试 (PVT)
政策漏洞测试是一个定性的、深入的测试阶段,由外部领域专家进行,包括来自 Institute for Strategic Dialogue 的研究人员。PVT 侧重于两个主要风险:用户接收到有害或不准确的信息,以及用户违反使用政策。
PVT 过程遵循三个阶段:
- 规划:选择政策领域,例如选举管理、政治平等以及恶意行为者的潜在滥用。
- 测试:专家构建非对抗性和对抗性提示词,以记录模型输出并根据政策进行基准测试。
- 审查:通过协作会议识别安全系统的差距并确定修复的优先级。
可扩展的自动化评估
为了提供人工测试无法实现的广度,Anthropic 使用了自动化评估。这些评估是通过使用语言模型,基于专家编写的 PVT 问题,采用 few-shot prompting 方法生成数百个测试问题而开发的。
自动化评估允许实现:
- 可扩展性:在几分钟内对多个模型变体进行数百个提示词的测试。
- 全面性:通过大型且有针对性的评估集来评估更广泛的场景。
- 一致性:通过在不同模型上应用一致的问题集来减少变异性。
为了确保质量,Anthropic 会手动审查这些生成问题的样本。在一次案例中,对 700 个关于欧盟选举管理问题中的 64 个问题进行审查发现,模型生成的 89% 的问题都是 PVT 工作的相关扩展。
风险缓解策略
来自 PVT 和自动化评估的结果促成了几项具体的的技术和政策干预措施:
- 系统提示词更新:在系统提示词中添加上下文,例如模型的知识截止日期,以帮助用户了解所提供信息的时效性。
- 模型微调:使用特定的训练数据来激励期望的行为。例如,Anthropic 为模型创建了一种“奖励”,使其引导用户参考权威来源。
- 政策细化:更新使用政策,明确禁止生成虚假信息、干预选举过程或支持特定的政治候选人或政党。
- 执行工具:利用经过微调的 Claude 版本来实时评估提示词和补全内容,并辅以人工审计以及对违反政策的用户进行停用处理。
- 直接用户重定向:实施 UI 元素,例如在 claude.ai 上显示弹出横幅,将美国用户重定向至 TurboVote,并将欧盟用户重定向至欧洲议会指南。
通过案例研究衡量有效性
Anthropic 使用其测试框架,在干预措施实施后重新运行相同的协议,以验证缓解措施是否真正有效。
知识截止日期引用
为了确保模型在处理时间敏感的选举查询时引用其知识截止日期(2023 年 8 月),Anthropic 更新了系统提示词。通过对比 Claude 2、Claude 3 Opus 的研究版本(不含提示词)和公开版的 Claude 3 Opus(含提示词),Anthropic 观察到这一优先缓解措施带来了 47.2% 的提升。
权威来源推荐
为了提高向权威来源推荐的频率,Anthropic 采用了模型微调。对比 Claude 2(未针对此行为进行微调)和 Claude 3 Opus(经过微调)的结果显示,在适当的情况下,模型引导用户参考可靠来源的频率提高了 10.4%。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch