AI 安全悖论:来自 Project Glasswing 的教训

几十年来,网络安全的主要挑战一直是“狩猎”——即在恶意行为者之前找到关键漏洞的艰苦过程。然而,Anthropic 最近关于 Project Glasswing 的更新表明,这一基本动态已经发生了转变。随着 Claude Mythos Preview 的推出,瓶颈不再是发现漏洞,而是人类验证、披露和修复它们的能力。

Project Glasswing 是 Anthropic 与约 50 个合作伙伴(包括主要银行和基础设施提供商)之间的协作努力,旨在高度能力 AI 模型被武器化用于攻击之前,保护关键软件的安全。

漏洞发现能力的量子飞跃

根据 Anthropic 的说法,Mythos Preview 的影响是即时且巨大的。合作伙伴报告称,漏洞发现率提高了十倍以上。发现的规模令人震惊:

  • 企业级影响: Cloudflare 报告称在关键路径系统中发现了 2,000 个漏洞(其中 400 个为高危或严重漏洞),并指出其误报率优于人类测试人员。
  • 开源项目扫描: 在对 1,000 多个开源项目的扫描中,Mythos Preview 估计识别出了 6,202 个高危或严重漏洞。
  • 验证率: 在由独立公司审核的高危漏洞中,90.6% 是有效的真阳性,62.4% 被确认为高危或严重漏洞。

除了简单的漏洞狩猎,该模型还展示了复杂的推理能力。英国 AI 安全研究所报告称,Mythos Preview 是第一个端到端解决其网络靶场(多步网络攻击模拟)中两个挑战的模型。它还通过检测到一起复杂的社会工程学攻击,帮助一家合作伙伴银行防止了一笔 150 万美元的欺诈性电汇。

新的瓶颈:“修复差距”

虽然 AI 可以秒级发现数千个漏洞,但修复它们的过程仍然顽固地保持着手动操作。这造成了一个危险的“过渡期”,即漏洞被发现的速度在不断加快,而补丁的部署却以人类的线性速度进行。

Anthropic 指出,开源软件的维护者已经不堪重负。一些人已请求 Anthropic 放慢 披露率,因为他们缺乏设计和部署补丁的能力。平均而言,Mythos Preview 发现的高危漏洞需要两周时间来修复——当发现过程自动化时,这一漏洞窗口期会显著扩大。

社区观点与怀疑论

与任何重大技术声明一样,Hacker News 社区对此反应不一,既有敬畏也有严谨的怀疑。一个反复出现的主题是区分 模型护栏(harness)。

"成功不仅来自于模型,也来自于围绕它构建的护栏... 我希望其他人能分享更多相关信息。" — @cpard

批评者认为,高真阳性率可能是复杂编排(“护栏”)的结果,而非模型原始智能的突破。其他人则指出了一些矛盾的证据,例如 curl 的维护者表示,Mythos 发现问题的程度并没有比现有工具显著更高。

此外,还存在更广泛的哲学担忧,即关于编程的未来。正如一位评论者 (@jimmar) 所指出的,我们可能正在接近一个未来,即手动构建不带重大漏洞的复杂系统被视为一种“不可能的挑战”,而人类驱动的编程将变得像预测中手动驾驶一样过时。

适应防御姿态

随着 Mythos 级模型预计最终进入公共领域,Anthropic argues 行业必须现在就开始适应。对于防御者的建议集中在缩短发现与部署之间的周期:

对于软件开发者

  • 加速补丁周期: 向持续安全更新迈进,并尽可能为最终用户提供无摩擦的安装过程。
  • AI 辅助修复: 使用像 Claude Security(目前处于 beta 阶段)这样的工具,不仅用于发现漏洞,还用于生成建议的修复方案。

对于网络防御者

  • 强化固化化: 减少对单个补丁的依赖,更多地转向系统性强化,例如多因素身份验证 (MFA) 和严格的网络配置。

前行之路

Anthropic 目前将 Mythos 级模型保持在私有状态,理由是缺乏足够强大的保护措施来防止严重的滥用。Project Glasswing 的目标是为防御者创造一种“非对称优势”,在破坏它们的工具变得普及之前,强化世界最关键的系统的安全。

如果成功,这种转变可能会导致一个世界,软件通过默认固化化来保证安全,而漏洞利用开发中的“猫鼠游戏”将从根本上向防御者倾斜。

Sources