Anthropic 与 NNSA 共同开发人工智能核安保分类器
Anthropic 与美国能源部(DOE)及国家核安全管理局(NNSA)合作开发了一款专用人工智能分类器,用于检测并防止人工智能模型被滥用于核武器研发。这一合作建立了公私部门协作的框架,旨在防范前沿人工智能模型面临的国家安全威胁,同时确保这些模型在合法的科研和教育用途中仍具实用性。
用于核扩散风险的人工智能分类器
Anthropic 与 NNSA 共同构建了一个自动化分类系统,旨在区分具有潜在风险的核相关对话与无害的讨论。在使用合成数据进行的初步测试中,该分类器整体准确率达到 96.2%,对核武器相关查询的检测率达到 94.8%,且零误报。
开发过程
该分类器通过反复的红队测试与验证循环开发而成:
- 风险指标识别:在 NNSA 对 Claude 模型进行为期一年的安全环境红队测试后,NNSA 提供了一套经过筛选的核风险指标。这些指标的分类级别允许其与 Anthropic 的政策与安保团队共享。
- 分类器构建:Anthropic 将这些风险指标转化为一个实时分类器,其功能类似于垃圾邮件过滤器,将对话标记为潜在有害或无害。
- 合成数据验证:为绕过国家安全机构与私营企业之间的信息共享限制,双方采用了合成数据生成技术。Anthropic 基于 NNSA 提供的示例生成了数百个测试提示,NNSA 随后对这些提示进行验证,以确保分类器评分与预期标签一致。
- 优化改进:根据 NNSA 的反馈,通过多轮测试与优化不断改进系统。
现实世界部署与性能表现
该分类器目前作为实验性组件部署于 Anthropic 的安保框架中,用于监控部分 Claude 流量。真实世界数据证实了该工具在合成测试环境之外的有效性。
处理灰色地带与上下文信息
部署数据显示,现实中的对话比合成数据更为复杂。例如,该分类器偶尔会将关于中东当前事件的无害讨论标记为可疑。Anthropic 通过使用 分层摘要 技术缓解了这些误报问题,该技术会将多个被标记的对话一并审查,以提供必要的上下文,从而识别出它们实为无害。
通过对抗性测试验证
该分类器的有效性在对抗性测试中得到进一步验证:即使 Anthropic 自身的红队成员在测试时并不知晓分类器已部署,该分类器仍成功识别出了他们使用的可疑提示。
行业影响与模式推广
Anthropic 正将其方法分享给前沿模型论坛(Frontier Model Forum),以鼓励其他人工智能开发者实施类似的安全保障措施。通过结合政府领域的专业知识与产业的技术能力,这一合作为自愿性的公私协作如何应对跨领域高风险国家安全威胁提供了可复制的范本。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch