Anthropic 美国大选准备工作

Anthropic 已部署了一套全面的安全措施,以防止其 AI 工具在 2024 年美国选举周期期间被滥用。这些工作重点在于禁止政治竞选、打击虚假信息,并引导用户获取权威、无党派的投票信息。

使用政策与禁止活动

Anthropic 已更新其使用政策,明确禁止使用 Claude 进行可能干扰选举完整性的活动。该政策侧重于三个主要的限制领域:

  • 政治竞选与游说: Claude 不能被用于推广特定候选人、政党或议题,也不能用于针对性的政治竞选,或征集选票和资金捐助。
  • Misinformation 与干扰: 禁止生成有关选举法、候选人和相关话题的虚假信息。此外,工具不能被用于针对投票机或阻碍计票和认证过程。
  • 媒体限制: 为了消除选举相关的 deepfakes 风险,Claude 仅限于文本输出,无法生成图像、音频或视频。

执行与检测机制

为了确保遵守这些政策,Anthropic 采用了自动化系统结合人工审核,以检测并防止滥用。执行策略包括:

  • Prompt 修改: 在 claude.ai 界面上实施对 prompts 的修改。
  • API 审计: 监控第一方 API 的使用案例。
  • 账号悬挂: 在发生极端政策违规的情况下,暂停账号使用。
  • 云服务合作伙伴关系: 与 Amazon Web Services (AWS) 和 Google Cloud Platform (GCP) 合作,以识别并减轻通过这些平台访问模型的用户所带来的危害。

漏洞测试与模型优化

Anthropic 利用针对性的红队测试 (red-teaming) 和自动化评估来识别并系统性地解决选举相关的风险。这一过程包括:

  • 政策漏洞测试 (PVT): 通过与外部领域专家合作,Anthropic 进行深入测试,以识别与偏见、虚假信息和对抗性滥用相关的风险。这包括记录模型对有关如何投票以及在哪里投票的问题的回答。
  • 自动化评估: 公司已开发出可扩展的测试,以衡量响应中针对不同候选人和话题的政治平衡性,衡量拒绝有害查询的有效率,以及衡量系统针对选民画像 (voter profiling) 策略的鲁棒性。
  • 迭代改进: 这些测试的结果被用于不断调整政策、加强执行,并优化模型的技术架构。

信息准确性与透明度

由于 AI 模型缺乏实时训练数据,Anthropic 已实施了特定的控制措施,以确保用户获得准确的投票信息:

  • 权威重定向: 向询问投票信息的用户展示一个弹窗,将其重定向到 TurboVote,这是 Democracy Works 提供的一个无党派资源,提供候选人姓名、投票提案和投票详情。
  • 知识截止日期透明度: Claude 的系统 prompt 已更新,以明确引用其知识截止日期,以防止用户依赖它获取实时选举数据。
  • 行业协作: Anthropic 已发布其部分自动化评估方法,并启动了一项计划,资助第三方评估,以改善整个 AI 行业的安全结果。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch