Anthropic 2024 年选举诚信策略
Anthropic 已推出一个全面的框架,以减轻 2024 年全球选举周期期间 AI 被滥用的风险。该策略侧重于防止政治竞选、减少虚假信息的传播,并确保用户获得权威的投票信息,而不是可能产生幻觉的 AI 回复。
禁止政治竞选和游说的严格政策
Anthropic 通过其《可接受使用政策》(AUP) 禁止使用其工具进行政治竞选和游说。这一限制专门防止候选人创建冒充他们的聊天机器人,并禁止使用 Claude 进行有针对性的政治竞选。
为了执行这些政策,Anthropic 采用自动化检测系统来识别虚假信息或影响力行动。执行措施遵循分层方法:
- 警告: 在发现滥用行为时向用户或组织发出。
- 暂停服务: 在极端情况下,撤销对工具和服务的访问权限。所有暂停服务均经过人工审核,以尽量减少误报。
对抗性测试与技术评估
自 2023 年以来,Anthropic 一直通过有针对性的红队测试进行“政策漏洞测试”,以识别系统可能被用于违反 AUP 的方式。该测试侧重于两个主要向量:
- 虚假信息与偏见: 分析系统如何响应有关候选人、选举管理和政治问题的查询。
- 对抗性滥用: 测试系统在面对请求提供选民压制策略的提示词时的韧性。
作为红队测试的补充,公司使用一套定量的内部评估套件来衡量:
- 政治对等性: 确保模型在不同候选人和话题上的回复一致性。
- 拒绝率: 衡量系统拒绝回答有害的选举相关查询的程度。
- 鲁棒性: 测试系统防止选民画像、针对性策略和虚假信息生成的能力。
将用户重定向至权威投票信息
为了应对幻觉风险——即模型产生错误信息——Anthropic 主动将寻求投票信息的用户重定向至非党派、权威的来源。由于模型训练频率不足以提供实时选举数据,因此其设计旨在引导用户远离针对关键投票查询的 AI 生成答案。
区域实施
- 美国: 向询问投票信息的美国用户展示一个弹出窗口,提供重定向至 TurboVote 的选项,这是由非党派组织 Democracy Works 提供的资源。
- 欧盟: 随着 Claude 在 2024 年 5 月扩展到欧洲,针对欧盟用户实施了类似的弹出窗口干预措施,将他们重定向至欧洲议会的非党派选举网站。
对非预期 AI 使用的自适应响应
Anthropic 承认 AI 部署通常会导致意想不到的效果和非预期的用途。公司正在开发实时检测其系统新兴、不可预见用途的方法,并承诺在发现时公开沟通这些发现。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch