Anthropic 选举保障措施更新

Anthropic 为 Claude 引入了更新后的选举保障措施,以确保模型在 2026 年美国中期选举和其他全球选举期间提供准确、公正且平衡的信息。这些措施结合了宪法训练、严格的评估基准和实时资源整合,以防止政治偏见和滥用。

通过中立性训练防止政治偏见

Claude 经过训练,能够以同等的深度和分析严谨性对待不同的政治观点,以防止模型将用户引导至特定视角。这种中立性通过两种主要机制实现:

  • Character Training: Claude 的宪法中定义的一组价值观和特征。模型因产生符合这些价值观和特征的响应而获得奖励。
  • System Prompts: 在 Claude.ai 上的每一次对话中都集成了关于政治中立性的明确指令。

为了验证这些保障措施,Anthropic 在每次模型发布前都会进行评估。在最近的测试中,Opus 4.7 得分为 95%,Sonnet 4.6 得分为 96%,在处理跨政治光谱的提示词时表现出公正的参与能力。Anthropic 已将其评估方法论和数据集开源,以允许外部复制。

此外,该公司正在与外部组织——包括 The Future of Free Speech、the Foundation for American Innovation 和 the Collective Intelligence Project——合作,以审查模型在言论自由方面的行为。

政策执行与风险缓解

Anthropic 的使用政策禁止使用 Claude 进行欺骗性政治竞选、创建虚假数字内容以影响舆论、实施选民欺诈、干扰投票系统或传播关于投票流程的误导性信息。

检测与防御机制

为了执行这些政策,Anthropic 采用了多层防御策略:

  • Automated Classifiers: 这些工具实时检测潜在的政策违规行为。
  • Threat Intelligence Team: 一个专门的团队负责调查并瓦解协调一致的滥用行为。

性能基准

Anthropic 使用 600 个提示词(300 个有害的和 300 个合法的)测试了 Claude 对其使用政策的遵守情况。结果显示,Claude Opus 4.7 在 100% 的情况下都做出了适当的响应,而 Claude Sonnet 4.6 在 99.8% 的情况下都做出了适当的响应

关于影响力行动——即协调一致地操纵公众舆论的努力——Sonnet 4.6 和 Opus 4.7 在模拟的多轮对话中,分别在 90% 和 94% 的情况下都做出了适当的响应

自主影响力行动

Anthropic 首次测试了模型是否能够自主规划并运行多步影响力竞选活动。虽然保障措施和训练使得最新的模型几乎拒绝了每一项任务,但在没有保障措施的测试中,Mythos Preview 和 Opus 4.7 完成了超过一半的任务,这表明尽管需要大量的人类指导,但仍需保持持续的警惕。

整合可靠的选举资源

为了确保用户获得事实性信息,Claude 通过选举横幅集成了指向受信任、非党派来源的直接链接。

  • US Midterms: 用户询问有关选民登记、投票地点或选票信息时,会被引导至 TurboVote,这是来自 Democracy Works 的资源。
  • Global Expansion: 计划在今年晚些时候的巴西选举期间采用类似的横幅系统,随后将进行进一步的全球扩展。

通过 Web Search 确保信息实时性

由于 LLM 具有固定的知识截止日期,Anthropic 使用 web search 来提供有关候选人宣布和选举结果的最新信息。在针对 2026 年美国中期选举的 600 多个提示词的评估中,Opus 4.7 和 Sonnet 4.6 分别在 92% 和 95% 的情况下触发了 web search,从而确保用户被引导至当前的数据。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch