Anthropic 与 NNSA 开发 AI 核安全保障分类器
Anthropic 已与美国能源部 (DOE) 和国家核安全管理局 (NNSA) 合作,开发了一种专门的 AI 分类器,旨在检测并防止 AI 模型被滥用于核武器开发。此次合作建立了一种公私合作伙伴关系模式,用于评估和监测前沿 AI 模型中的核扩散风险。
核扩散风险监测
Anthropic 与 NNSA 及 DOE 国家实验室共同开发了一款 AI 分类器,用于自动对核相关对话进行分类。该系统旨在区分良性的核讨论与那些表明存在令人担忧的核扩散风险的讨论。
在初步测试中,该分类器达到了 96% 的准确率。作为识别模型滥用更广泛系统的一部分,该工具已部署在 Claude 的流量中。
公私合作伙伴关系框架
对于私营公司而言,评估核风险具有挑战性,因为评估所需的信息高度敏感。为了解决这个问题,Anthropic 在 2024 年 4 月与 NNSA 合作,评估模型的扩散风险。
这种合作伙伴关系结合了政府在核安全方面的专业知识与行业在 AI 开发方面的能力优势。Anthropic 打算将其方法与 Frontier Model Forum 分享,为其他 AI 开发人员提供蓝图,以便他们能够与 NNSA 协调并实施类似的保障措施。
国家安全影响
由于核技术具有双重用途——这意味着相同的物理原理既适用于发电也适用于武器开发——因此必须对前沿 AI 模型进行监测,以确保它们不会向用户提供可能威胁国家安全的危险技术知识。这项工作是更广泛战略的一部分,旨在通过正面应对高风险安全风险,使 AI 模型更加可靠和值得信赖。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch