Anthropic 选举保障措施更新
Anthropic 为 Claude 引入了更新后的选举保障措施,以确保模型在 2026 年美国中期选举和其他全球选举期间提供准确、公正且平衡的信息。这些措施结合了宪法训练、严格的评估基准和实时资源整合,以防止政治偏见和滥用。
通过中立性训练防止政治偏见
Claude 经过训练,能够以同等的深度和分析严谨性对待不同的政治观点,以防止模型将用户引导至特定视角。这种中立性通过两种主要机制实现:
- Character Training: Claude 的宪法中定义的一组价值观和特征。模型因产生符合这些价值观和特征的响应而获得奖励。
- System Prompts: 在 Claude.ai 上的每一次对话中都集成了关于政治中立性的明确指令。
为了验证这些保障措施,Anthropic 在每次模型发布前都会进行评估。在最近的测试中,Opus 4.7 得分为 95%,Sonnet 4.6 得分为 96%,在处理跨政治光谱的提示词时表现出公正的参与能力。Anthropic 已将其评估方法论和数据集开源,以允许外部复制。
此外,该公司正在与外部组织——包括 The Future of Free Speech、the Foundation for American Innovation 和 the Collective Intelligence Project——合作,以审查模型在言论自由方面的行为。
政策执行与风险缓解
Anthropic 的使用政策禁止使用 Claude 进行欺骗性政治竞选、创建虚假数字内容以影响舆论、实施选民欺诈、干扰投票系统或传播关于投票流程的误导性信息。
检测与防御机制
为了执行这些政策,Anthropic 采用了多层防御策略:
- Automated Classifiers: 这些工具实时检测潜在的政策违规行为。
- Threat Intelligence Team: 一个专门的团队负责调查并瓦解协调一致的滥用行为。
性能基准
Anthropic 使用 600 个提示词(300 个有害的和 300 个合法的)测试了 Claude 对其使用政策的遵守情况。结果显示,Claude Opus 4.7 在 100% 的情况下都做出了适当的响应,而 Claude Sonnet 4.6 在 99.8% 的情况下都做出了适当的响应。
关于影响力行动——即协调一致地操纵公众舆论的努力——Sonnet 4.6 和 Opus 4.7 在模拟的多轮对话中,分别在 90% 和 94% 的情况下都做出了适当的响应。
自主影响力行动
Anthropic 首次测试了模型是否能够自主规划并运行多步影响力竞选活动。虽然保障措施和训练使得最新的模型几乎拒绝了每一项任务,但在没有保障措施的测试中,Mythos Preview 和 Opus 4.7 完成了超过一半的任务,这表明尽管需要大量的人类指导,但仍需保持持续的警惕。
整合可靠的选举资源
为了确保用户获得事实性信息,Claude 通过选举横幅集成了指向受信任、非党派来源的直接链接。
- US Midterms: 用户询问有关选民登记、投票地点或选票信息时,会被引导至 TurboVote,这是来自 Democracy Works 的资源。
- Global Expansion: 计划在今年晚些时候的巴西选举期间采用类似的横幅系统,随后将进行进一步的全球扩展。
通过 Web Search 确保信息实时性
由于 LLM 具有固定的知识截止日期,Anthropic 使用 web search 来提供有关候选人宣布和选举结果的最新信息。在针对 2026 年美国中期选举的 600 多个提示词的评估中,Opus 4.7 和 Sonnet 4.6 分别在 92% 和 95% 的情况下触发了 web search,从而确保用户被引导至当前的数据。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch