Anthropic 为 AI 安全进行前沿威胁红队测试
Overview
Anthropic 引入了一种“前沿威胁红队测试”(frontier threats red teaming)方法,旨在识别并缓解可能对国家安全构成风险的 AI 能力,例如生物安全和网络安全。这种对抗性测试框架旨在揭示可能被恶意行为者利用的潜在模型能力,从通用的众包红队测试转向专门的、由专家领导的评估。
Methodology for Frontier Threats Red Teaming
前沿威胁红队测试需要对领域专家知识和时间进行密集投入,以揭示潜在的模型能力。Anthropic 的流程包括以下关键组成部分:
- Expert Collaboration: 专家协作:该过程始于与拥有数十年经验的领域专家合作,以定义威胁模型。这些模型识别哪些信息是危险的,这些信息如何组合以造成危害,以及信息达到危险程度所需的准确性和频率。
- Intensive Probing: 密集探测:领域专家和 LLM 专家投入大量时间(100+ 小时)与模型进行交互,以探测其能力。这包括学习如何“越狱”(jailbreak)模型以绕过安全过滤器。
- Automated Evaluations: 自动化评估:一个主要目标是基于专家知识开发新的、自动化的评估方法和工具,使测试过程具有可重复性和可扩展性。
- Secure Infrastructure: 安全基础设施:由于揭示的信息具有高度敏感性,这项工作是通过与值得信赖的第三方建立合作伙伴关系并实施强大的信息安全保护来进行的。
Findings from Biosecurity Red Teaming
Anthropic 进行了一项专注于生物风险的测试项目,与生物安全专家合作,在不具备面向公众的信任与安全监控的安全性接口下,投入了超过 150 小时。
Key Risks Identified
- Expert-Level Knowledge: 专家级知识:前沿模型偶尔可以产生专家级别的复杂、准确且详细的知识。随着模型规模的扩大,这种能力也在增强。
- Acceleration of Harm: 危害加速:与仅使用搜索引擎相比,未经过缓解措施的 LLM 可能会加速恶意行为者滥用生物学知识的能力,从而实现原本无法完成的任务。虽然目前这些影响还很小,但它们正在迅速增长。
- Near-Term Timeline: 短期时间线:Anthropic 估计,如果不对这些生物风险进行缓解,它们可能会在未来两到三年内成为现实,而不是五年或更久。
Implemented Mitigations
Anthropic 发现,通过特定的干预措施,可以大幅降低这些风险:
- Training Process Adjustments: 训练过程调整:训练过程中的变化,例如在 Constitutional AI 中使用的技术,有助于模型更好地区分有害和无害的生物学用途。
- Classifier-Based Filters: 基于分类器的过滤器:这些过滤器使行为者更难获得用于造成危害所需的链式、专家级信息。 这些缓解措施目前已部署在 Anthropic 的面向公众的前沿模型中。
Future Research and Industry Implications
Anthropic 认为,当前前沿模型的状态为行业提供了一个“警示信号”。该公司正专注于以下未来方向:
- Comparative Speedup Analysis: 对比性加速分析:衡量在下一代、使用工具的模型和多模态模型中,相比于传统搜索引擎,LLM 在产生危害方面提供的加速程度。
- Open-Weight Model Risks: 开源权重模型风险:Anthropic 警告,恶意行为者可能会从基于公开可用的、具有足够能力的基座模型权重进行微调的小型模型中,提取出有害的生物学能力。
- Collaborative Disclosure: 协作式披露:Anthropic 正在建立一个披露流程,向其他实验室和政府机构报告风险和缓解措施。
- Third-Party Evaluation: 第三方评估:该公司倡导建立公正的第三方组织,在对敏感信息采取适当保护措施的前提下,进行国家安全评估。
Scaling the Research Agenda
Anthropic 正在扩大其前沿威胁红队测试团队,以实验未来的能力并构建可扩展的评估方法。该框架旨在应用于其他长期风险,例如模型欺骗,通过识别应避免的未来能力,并在这些能力出现之前建立对齐技术。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch