Anthropic 大型语言模型与生物风险:评估人工智能驱动的生物威胁
概要
Anthropic 已在 Claude Opus 4 上启用人工智能安全等级 3(ASL-3)防护措施,以防止该模型协助设计化学、生物、放射性或核武器,并发布了对大型语言模型(LLMs)可能加剧生物风险的全面分析,以及可采取的缓解措施。
为何 ASL-3 防护措施至关重要
Anthropic 在发布 Claude Opus 4 时启用 ASL-3 保护,因为性能提升使得无法再排除该模型可能帮助具备基本 STEM 背景的个人开发 CBRN 武器的可能性。这些防护措施重点在于阻止那些寻求生物武器化指导、设计或详细知识的查询。
"...在我们的评估中提升模型性能意味着,我们已无法再自信地排除我们最先进的模型在有人试图开发此类武器时,可能提升普通人(具备基本 STEM 背景)能力的可能性。鉴于我们对潜在后果的评估,我们评估和相应安全措施的主要初始重点是生物武器。" – Anthropic, LLMs and biorisk
大型语言模型与生物武器的交汇点
人工智能作为现代信息通道
历史上,恐怖组织从印刷手册转向在线搜索武器制造指南。Anthropic 认为,人工智能将成为下一步:一种能够过滤相互矛盾的互联网内容、提供实时指导并生成可执行协议的对话式助手。
生物学的独特风险
- 高影响后果 – 一次成功的病毒攻击可在全球传播,不同于大多数常规武器。
- 降低的物质门槛 – 核酸合成成本、标准化试剂盒和廉价 PCR 仪器的价格已大幅下降,减少了对专业供应链的依赖。人工智能进一步削弱了剩余的信息壁垒。
模型知识与专家专长的对比
大型语言模型(LLMs)在广泛的语料库上进行训练,包括科学论文、教科书和在线讨论,使其具备广泛的生物学知识基础。Anthropic 的内部评估显示,Claude 在专业基准测试中的表现已接近或超过专家人类基准水平。
病毒学故障排查基准(VCT)
在一年内,Claude 在 SecureBio 设计的病毒学故障排查(VCT)评估中,从表现低于世界级专家,迅速提升至轻松超越专家水平。

图 1. Claude 在 VCT 上的表现,显示其迅速达到专家级分数。
这一趋势在多个分子生物学基准测试中均可见,表明大型语言模型可以获取与专家相当的广度和深度。
实际提升的证据
Anthropic 进行了受控试验,参与者在两天内起草生物武器获取计划。
- 对照组: 仅可访问标准互联网资源。
- 实验组: 相同资源 加上 Claude 4(研究期间临时移除防护措施)。
由生物防御专家评分的结果显示,Claude 辅助的参与者整体得分更高,且关键失败更少。

图 2.(上)提升试验的原始分数;(下)关键失败次数。使用 Claude 的小组表现显著更优。
Anthropic 指出,尽管基于文本的提升试验无法完全代表现实世界实验室工作,但它们展示了非专家获得更优指导的合理路径。
实验室层级实验
一项小型 2024 年湿实验试点(n = 8)比较了使用 Claude 与仅使用互联网资源的参与者在基础生物学实验流程中的表现。未观察到统计学意义上的提升,但两组表现均出人意料地出色,表明隐性实验室知识可能并非如预期那样构成主要瓶颈。
Anthropic 目前正与前沿模型论坛(Frontier Model Forum)和 Sentinel Bio 共同赞助一项更大规模的湿实验研究,以系统评估:
- 非专家在真实实验任务中的基准表现。
- 提供人工智能辅助后的增量提升。
扩大后的试验将明确隐性知识的作用以及人工智能驱动风险的规模。
缓解策略
信息共享与公私合作
Anthropic 强调持续与生物防御专家、美国人工智能标准与创新中心(CAISI)以及英国人工智能安全研究所进行磋商。其倡导透明的负责任扩展政策,并发布危险能力评估报告。
自动化部署防护措施
- 宪法分类器 实时监控输入/输出,阻止一小类有害信息。
- ASL-3 保护 目前仅作为预防性措施应用于 Claude Opus 4 系列(详见详细的 ASL-3 报告)。
- 安全保障团队持续监控平台活动中的滥用模式,并可实施纠正措施。
国家政策协调
Anthropic 欢迎美国人工智能行动计划对生物安全的关注,包括加强核酸合成筛查和由 CAISI 主导的安全评估。文中强调,政府与产业界的协调努力对于构建抵御人工智能驱动生物风险的韧性至关重要。
相关 Anthropic 研究
Sources
- OriginalLLMs and biorisk
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch