Anthropic 前沿模型安全框架
TL;DR
Anthropic 提出了一套针对前沿 AI 模型的网络安全最佳实践,强调这些模型的战略重要性要求其安全级别超过标准的商业技术。该框架的核心是对关键基础设施实施双人控制,并采用安全的软件开发标准,以保护模型权重和研究成果免受盗窃或滥用。
AI 关键基础设施的多方授权
Anthropic 主张“双人控制”(two-party control),这是一种安全模式,即没有任何个人可以持久访问生产关键环境。为了获得访问权限,个人必须向同事请求限时权限并提供业务理由。
这种方法被 Anthropic 称为 AI 关键基础设施设计中的多方授权,旨在减轻内部风险并防御高级威胁行为者。Anthropic 指出,这种模式在金融服务、医疗器械制造 (ISO 13485) 和食品安全 (ISO 22000) 等高安全性领域已非常普遍,即使是资源有限的新兴 AI 实验室也适用。
安全模型开发框架
为了确保 AI 系统的完整性和来源,Anthropic 建议采用基于现有软件安全标准的 安全模型开发框架。具体而言,该实验室指出有两个金标准框架:
- NIST Secure Software Development Framework (SSDF): 一套旨在减少已发布软件中漏洞数量的实践。
- Supply Chain Levels for Software Artifacts (SLSA): 一个用于确保软件制品完整性的框架。
Anthropic 认为,生产和部署模型在功能上与构建和部署软件是完全相同的。通过实施 SSDF 和 SLSA,实验室可以建立“监管链”(chain of custody),使部署的模型可以追溯到开发它的公司。Anthropic 鼓励 NIST 将 SSDF 扩展到其标准制定过程中,以明确涵盖模型开发。
公私合作与监管方法
Anthropic 建议将前沿 AI 研究视为“关键基础设施”,类似于金融服务行业。这种认定将促进政府机构与 AI 实验室之间加强信息共享与合作,从而更好地防御资源丰富的恶意行为者。
关于实施,Anthropic 提出了一个分阶段实施的方法:
- 自愿安排: 初始安全措施可以从实验室之间的自愿协议开始。
- 采购要求: 政府可以利用采购指南(类似于 EO 14028)来强制要求与政府签约的 AI 公司和云服务商遵守这些安全标准。
- 监管强制: 随着时间的推移,政府监管权力可能会被用于强制整个行业遵守合规性。
实施状态
Anthropic 目前正在实施双人控制、SSDF 和 SLSA。公司承认,虽然安全措施有时可能会干扰生产力,但随着模型能力的扩展,这些预防措施是必要的,并且需要通过与行业和政府合作伙伴协商,进行迭代式的增强过程。
Sources
- OriginalFrontier Model Security
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch