Mythos 与追求完美代码库:来自 curl 扫描的教训
在 2026 年 4 月,Anthropic 发布了 Mythos,这款被称为在识别源代码安全漏洞方面“好得危险”的新 AI 模型,引发了业界的巨大轰动。由于宣传势头过于猛烈,Anthropic 限制了该模型的公开发布,转而选择向少数几家公司逐步开放访问权限,以便让他们在公众能够使用该工具之前修复关键漏洞。
对于许多人来说,这听起来像是安全末日的开始。对于 curl 的首席开发者 Daniel Stenberg 而言,这是一个观察 AI 领域中最受瞩目的模型是否能在现存最受审查的代码库之一中发现端倪的机会。
挑战:在 curl 上测试 Mythos
要理解 Mythos 扫描的意义,首先必须了解 curl 的本质。curl 拥有大约 176,000 行 C 代码,是一个打磨得非常精良的软件工程作品。平均每一行生产代码都经过了 4.14 次的编写与重写。它被安装在超过两百亿个实例中,运行在 110 个操作系统和 28 个 CPU 架构上。
由于这种无处不在的特性,安全性是重中之重。curl 项目已经采用了一套严密的防御策略:
- 持续模糊测试 (Continuous Fuzzing): 大量使用 OSS-Fuzz。
- 静态分析 (Static Analysis): 持续使用 Coverity 和 CodeQL。
- AI 驱动的扫描: 在 Mythos 出现之前,curl 已经使用过 AISLE、Zeropath 和 OpenAI 的 Codex Security 等工具进行过扫描,在过去的 10 个月中,这些工具触发了 200 到 300 个漏洞修复,其中包括十几个甚至更多的 CVE。
- 人工审查: AI 工具被用于补充而非取代对 pull requests 的人工同行评审。
结果:五个发现,一个漏洞
当 Mythos 报告在 2026 年 5 月 6 日送达时,它分析了 178K 行代码。由于该项目的密集审计,AI 正确地识别出在 curl 的“热路径”(HTTP/1、TLS 和 URL 解析)中发现漏洞的可能性较低。
Mythos 自信地报告了五个“已确认的安全漏洞”。然而,在 curl 安全团队的深度挖掘后,该列表被大幅缩减:
- 三个是误报(记录在案的 API 短板)。
- 一个被认为“仅仅是一个 bug”。
- 一个是确认的漏洞。
这个单一的确认漏洞被归类为 severity low,并计划在 6 月下旬随 curl 8.21.0 的发布一起发布 CVE。
虽然 Mythos 也识别出了大约 20 个其他 bug——团队目前正在修复中——但发现的问题总量低于之前使用的 AI 工具。
营销噱头 vs. 技术现实
基于这些结果,Stenberg 认为围绕 Mythos 的“好得危险”的说法主要是一种营销手段。他没有发现任何证据表明 Mythos 在识别问题方面比之前的 AI 驱动工具具有显著更高或更先进的程度。
然而,这个结论带有一个至关重要的前提。curl 是一个极端的离群值。正如一位 Hacker News 评论者所言:“curl 已经被各种可用工具分析得透透彻彻了;大多数软件并没有达到那个水平。”对于普通的代码库——那些缺乏 curl 那样数十年的打磨和庞大的模糊测试基础设施的代码库——Mythos 和类似的模型很可能是危险的,因为它们可以揭示大量人类审计员可能会忽略的“低垂果实”。
AI 在安全领域的真实价值
尽管对 Mythos 的宣传存在质疑,但大趋势是不可否认的:AI 驱动的代码分析器比传统的静态分析器更有效。根据 curl 项目的说法,AI 工具的优势包括:
- 上下文感知能力: 它们可以检测代码与其随附注释之间的矛盾。
- 跨平台洞察力: 它们可以检查开发者无法实际运行的平台的配置。
- API 和协议知识: 它们可以根据其训练数据识别对第三方库的滥用或对协议规范的违反。
- 可解释性: 它们提供漏洞的摘要和解释,并通常可以建议(尽管并不总是完美)补丁。
结论: “高品质的混乱”
我们正在进入一个“高品质的混乱”时代,安全研究人员正在使用 AI 来向项目中注入高品质的报告。虽然 Mythos 可能没有重新定义漏洞发现领域,但它代表了 AI 工具成为安全栈中强制性组成部分的一个发展轨迹。
正如 Stenberg 警告所言,若在项目中不使用 AI 代码分析器,就意味着为对手留下了先发制人的机会。curl 项目的目标是继续使用 Mythos 和其他模型进行扫描,直到它们真正停止发现新问题为止。