Anthropic 改进了 Claude Fable 5 的生物学安全防护措施
Anthropic 更新了 Claude Fable 5 的生物学安全防护措施,在其产品界面中将与生物学相关的“回退”(fallback)——即系统将查询重定向至能力较低的模型——减少了约 85%。此次更新允许 Fable 5 协助处理更广泛的良性生物学任务,包括教育查询和日常健康问题,同时继续限制高风险的双重用途能力。
扩大对良性生物学任务的访问权限
Fable 5 现在可以处理更广泛的生物学相关请求,且误报率显著降低。用户在执行以下任务时将体验到更少的干扰:
- 日常健康与教育: 解读实验室结果、理解症状以及在教育背景下学习生物学。
- 临床支持: 医疗保健专业人员现在可以从 Fable 5 获取更多关于临床任务的支持。
尽管有了这些改进,Fable 5 仍会将涉及病毒学、毒理学和分子设计的请求路由至 Opus 5。这些领域被归类为双重用途,目前尚不适用于专业生物学研究或药物开发。
双重用途生物学能力的风险
Anthropic 维持严格的安全防护措施,是因为 Fable 5 的生物学能力在某些复杂任务上可能超越专家,从而为恶意行为者带来“能力提升”(uplift)风险。主要的挑战在于生物学研究的“双重用途”性质,即用于有益目的的相同技术可以被重新利用于有害目的。
- 意图的模糊性: 研究治疗方法通常需要产生危险化合物。例如,制造活疫苗需要培养疫苗旨在预防的同种病原体,而高血压药物 captopril 的开发则需要分离蛇毒中的有毒成分。
- 外部威胁: Anthropic 引用了美国情报界 2026 年年度威胁评估报告,该报告指出,合成生物学和基因组编辑的进步可能会导致新型生物威胁,特别是来自拥有进攻性生物和化学武器计划的国家行为者。
由于存在灾难性误用的可能性,Fable 5 最初发布时几乎屏蔽了所有的生物学查询,以确保在其他领域实现通用可用性,同时不断完善安全防护措施。
生物学安全防护措施的技术实现
Anthropic 利用安全分类器——较小的、自动化的 AI 系统——来检测何时 Fable 5 被要求执行受保护的任务或产生有害输出。
回退机制
当安全分类器被触发时,系统并不会简单地屏蔽请求;相反,它会将用户的查询重定向至 Opus 5。Opus 5 是一款能力很强的模型,但缺乏 Fable 5 的高级生物学能力,从而限制了恶意用户可能获得的协助。
完善分类器
为了在不增加漏报率(漏掉有害内容)的情况下减少误报率,Anthropic 实施了以下更新:
- 宪法重写: 团队重写了分类器的“宪法”(用于区分受保护内容和允许内容的规则集),以更详细地定义良性用途。
- 专家咨询: Anthropic 向来自内部和外部的多元化专家小组征求了关于这些变化的反馈。
- 重新训练: 使用基于新宪法更新的训练数据对分类器进行了重新训练,并验证了其确保在允许更多良性内容的同时,仍然能针对有害和双重用途研究触发警报。
Anthropic 承认,一些误报仍将保留在一定的“安全边际”内,即出于极度谨慎的考虑,低风险请求仍会被屏蔽。公司致力于为专业研究人员开发可信的访问路径,以便安全地使用前沿生物学能力。
Sources
- OriginalImproving Fable 5 Safeguards
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch