Anthropic 2024 年选举与 AI 观察报告
Anthropic 报告称,在 Claude.ai 及其 API 的整体使用量中,与选举相关的活动占比不足 0.5%,而在美国大选前的几周内,这一比例上升至略高于 1%。这表明,尽管生成式 AI 在重大选举周期内已变得广泛使用,但其在选举相关查询中的实际使用量在模型总交互量中仍占极小比例。
选举安全框架与执行
Anthropic 在整个 2024 年实施了三管齐下的安全方法,以减轻与选举相关的风险:
- 政策执行: 公司的 Usage Policy 禁止选举干预、竞选活动、推广候选人或政党、征集捐款以及生成虚假信息。2024 年 5 月,这些政策得到了扩展,专门针对选民定位、身份冒充和影响力活动。
- 严格测试: Anthropic 与外部专家进行了十多轮政策漏洞测试(针对性红队测试)。测试重点在于有害查询的拒绝率、候选人之间的公平性,以及对不准确信息的检测。针对印度、南非、墨西哥、英国、法国和欧盟议会的选举进行了定期测试,并在美国大选期间对虚假信息叙事进行了每日测试。
- 权威引用: 寻求投票信息的用户被引导至非党派来源,例如美国的 TurboVote/Democracy Works、英国选举委员会(UK Electoral Commission)以及法国行政选举网站。
在全球范围内,Anthropic 采取了约 100 次与选举相关的执行行动,包括对重复违规者的警告和账号封禁。公司指出,聊天机器人放大风险的可能性低于社交媒体,因为 Claude 通过一对一交互运行,且目前仅输出文本,这消除了深度伪造(deepfakes)的威胁。
通过 Clio 工具进行使用情况分析
Anthropic 利用名为 Clio 的新型自动化工具来分析现实世界的语言模型使用情况。Clio 将原始对话提炼为抽象的主题集群,以提供关于模型如何被使用或被误用的见解。
对美国大选使用情况(11 月 2 日至 8 日)的分析显示,大约三分之二的选举相关对话涉及以下请求:
- 分析并解释政治体制、政策、时事和政治问题。
- 分析政治数据,包括投票模式和政治趋势。
其他用例包括翻译选举信息以及生成有关政府和民主的教育性内容。
解决知识截止日期限制问题
Anthropic 识别出,需要就模型知识截止日期进行透明沟通,以防止在突发选举期间产生令人困惑的响应。例如,当法国在 2024 年夏季举行突发选举时,Claude(训练截止至 2024 年 4 月)无法提供有关新选举时间表的准确信息。
为了解决这个问题,Anthropic 通过两个主要渠道实施了更清晰的沟通:
- 模型系统提示词(Model System Prompts): 更新系统提示词以明确说明截止日期。
- 用户界面: 在 UI 中实施选举横幅,以鼓励用户寻求权威来源。
未来展望
Anthropic 认为,保护选举完整性需要不断的适应。公司致力于加强行业协作、开发更复杂的测试系统,并保持其研究结果的透明度,以保护民主进程。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch