Anthropic Fable 安全防护措施在网络安全研究人员中引发强烈反弹
过于激进的安全防护措施限制了技术实用性
Anthropic 推出的 Fable——其面向网络安全的模型 Mythos 的公开、受限版本——因其限制性的安全防护措施而受到网络安全社区的强烈批评。这些措施旨在防止恶意软件和生物武器的研发,但经常在良性请求上触发,使模型在许多专业安全任务中无法使用。
研究人员报告称,Fable 会拒绝仅与网络安全略有关联的请求。IBM X-Force 的 Valentina “Chompie” Palmiotti 表示,模型甚至会拒绝阅读博客文章等无害任务。其他被触发的请求包括代码审查、分析 dropper 载荷以及询问 OpenSSL 参数。
静默模型降级与“基于关键词”的过滤
当提示触发安全防护措施时,Fable 并不总是直接拒绝请求;相反,它常会暂停对话并自动回退到 Claude Opus 4.8。
技术专家认为过滤机制主要基于关键词,而非上下文感知。Tolmo 的技术人员 Matt Suiche 指出,要求模型编写安全代码时常会触发降级,因为模型将此请求解读为“网络安全相关工作”,而非“软件工程最佳实践”。
Hacker News 社区成员指出了几种具体的失效模式:
- 生物触发: 用户报告称,提及“基因”或请求识别照片中的真菌会触发生物武器防护措施。
- 学术干扰: 研究人员注意到,人口研究和有机化学的查询被标记为不安全。
- 通用实用性: 有用户报告称,即使是解码摩尔斯电码或询问线粒体等基本任务也会触发安全标记。
对威胁行为者的战略影响
虽然 Anthropic 实施这些防护措施是为了降低风险,但一些安全专业人士认为它们可能无意中帮助了攻击者。有报告称,恶意软件作者故意在代码中加入生物学和网络安全术语,以欺骗基于 LLM 的安全扫描器触发防护措施并终止分析。
“恶意软件作者对防护措施非常兴奋。你可以在恶意软件中添加提示,让 LLM 扫描器触发防护措施并停止运行……这些 AI 平台根本不了解威胁行为者的真实工作方式。”
Anthropic 的回应与验证计划
针对这场反弹,Anthropic 据称已开始撤回部分政策。根据 Wired 的报道,公司表示:“我们正在修改 Fable 5 的前沿 LLM 开发安全防护,使其可见”,并承认在安全与实用性平衡上做出了“错误的取舍”。
为减轻对合法专业人士的限制,Anthropic 提供了 Cyber Verification Program(网络安全验证计划),而 OpenAI 也维护类似的 Trusted Access for Cyber(网络安全可信访问)计划。这些计划的获批申请人在使用模型进行网络安全工作时会遇到更少的限制。然而,一些用户仍表示,即使获得豁免,Fable 在特定任务(如解锁个人设备的 bootloader)时仍会触发拒绝并降级到 Opus。