Anthropic 第三方测试 AI 政策提案
TL;DR
Anthropic 主张为前沿 AI 系统建立第三方测试机制,以验证安全声明并防止社会危害。这种方法旨在创建一个广泛受信任的监督基础设施,涉及行业、政府和学术界,以管理仅靠自我治理无法解决的风险。
第三方监督的必要性
前沿 AI 系统——需要大量计算资源的大规模生成式模型——充当“万能机器”,可以适应无数下游用例。由于这些系统继承了基础模型的各种能力和弱点,它们无法简单地归入现有的特定行业监管框架中。
Anthropic 认为,虽然自我治理框架(例如他们自己的 Responsible Scaling Policy (RSP))至关重要,但它们是不够的,因为它们依赖于单个私人参与者的决策。一个强大的第三方机制是必要的,以:
- 验证安全: 对模型在选举完整性、有害歧视和国家安全误用方面的行为提供独立验证。
- 防止灾难性事故: 识别涌现的、自主的行为,例如在代码中插入漏洞或与人类意图相悖的行为。
- 避免“膝跳反应”式监管: 主动设计有效的监管,以防止发生可能导致压抑且无效的立法反应的重大事件。
强大测试机制的框架
一个有效的测试机制必须精确界定范围,仅适用于计算密集度最高的大规模系统,以避免对较小公司造成不利影响。Anthropic 提出以下结构性组成部分:
两阶段测试流程
- 自动化阶段: 一个快速、广泛的测试阶段,偏向于避免假阴性,以便快速发现潜在问题。
- 专家阶段: 一个彻底的二次测试,针对标记出的问题,利用专家主导的人类引导式探测。
多样化的测试生态系统
测试应由各种参与者进行,以确保合法性和竞争:
- 私营公司: 分包公司(例如 Gryphon Scientific)或类似于金融会计中使用的审计公司。
- 大学: 管理测试计划的学术机构,可能由政府机构监督。
- 政府: 针对特定、法律授权的领域进行直接测试,特别是涉及机密国家安全风险的领域。
实施的关键要求
- 共享标准: 行业、政府和学术界在安全测试框架应包含哪些内容方面达成共识。
- 政府资助: 增加对政府机构(例如 NIST, US AI Safety Institute)的资源投入,以资助构建和分析测试的技术工作。
- 公共基础设施: 创建“国家研究云” (National Research Clouds),以允许学术界和政府开发独立的能力来研究和测试前沿系统。
国家安全与高风险能力
Anthropic 识别国家安全为第三方测试至关重要的一个主要领域。具体而言,系统应针对可能危害国家安全的能力进行测试,例如加速生物武器制造的能力或执行复杂的网络攻击。如果发现此类能力,Anthropic 建议采取缓解措施,例如从广泛部署的模型中移除这些能力,或实施“了解你的客户” (KYC) 机制。
应对开源模型与监管俘获
公开分发模型
Anthropic 承认开源研究的价值,但认为随着模型能力的增强,完全公开分发的文化可能会与社会安全发生冲突。他们提出,如果一个模型是公开发布的,它必须能够抵御可能导致误用的微调。第三方测试被视为定义不可接受的误用并将其标准一致地应用于专有模型和开源权重模型(open-weight models)的唯一合法途径。
减轻监管俘获
为了防止资源雄厚的 AI 公司利用监管来扼杀竞争,Anthropic 主张建立独立于大公司的测试能力。通过关注测量和第三方能力,而不是高成本的合规性财团,该政策旨在为较小的开发者维持一个公平的竞争环境。
Anthropic 对支持的承诺
为了帮助开发这一机制,Anthropic 承诺:
- 通过其 Responsible Scaling Policy (RSP) 进行测试机制的原型设计。
- 通过承包商和政府合作伙伴进行第三方评估测试。
- 扩展前沿红队测试 (red teaming) 以澄清风险和缓解措施。
- 倡导政府资助 NIST 等机构并开发国家研究基础设施。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch