Mythos 與尋找 curl 漏洞的探索:AI 炒作 vs. 現實

在 2026 年 4 月,Anthropic 為其新的 AI 模型 Mythos 產生了巨大的媒體關注,聲稱它在識別原始碼中的安全缺陷方面「好得危險」。這種炒作如此激烈,以至於 Anthropic 限制了公眾訪問,僅將該模型逐步提供給少數公司,以便讓他們在正式發布前修復關鍵問題。對許多人來說,這引發了對軟體安全未來的生存恐懼;對其他人來說,這看起來像是一場行銷大師課。

curl 的首席開發者 Daniel Stenberg 最近有機會對這些說法進行測試。透過 Linux Foundation 和 project Alpha Omega,curl 使用 Mythos 進行了掃描,以查看這個「神奇模型」是否能揭示全球受檢視最嚴密的 C 語言程式碼庫之一的漏洞。

挑戰:掃描一個「精煉」的程式碼庫

要理解 Mythos 掃描的結果,首先必須了解 curl 的本質。curl 擁有大約 176,000 行 C 語言程式碼和 660,000 個單詞——大約比《戰爭與和平》英文版多出 12%——就部署而言,curl 是一個龐大的專案。它運行在超過 110 個作業系統和 28 個 CPU 架構上,在全球安裝了超過兩百億個實例。

更重要的是,curl 並非典型的程式碼庫。它是現存受 fuzzing(模糊測試)和審計最嚴密的專案之一,利用了 OSS-Fuzz、Coverity、CodeQL 以及多次付費審計。Stenberg 指出,每一行生產環境中的程式碼平均都被編寫和重寫了 4.14 次。這種精煉程度使其成為任何分析器(無論是 AI 還是人類)極其困難的目標。

結果:五項發現,一個漏洞

Mythos 報告最初聲稱發現了五個「已確認的安全漏洞」。然而,在 curl 安全團隊進行深入研究後,該列表被大幅縮減:

  • 三個誤報: 問題已作為 API 文檔中的缺點被記錄。
  • 一個「只是個 bug」: 一個未達到安全漏洞門檻的問題。
  • 一個已確認的漏洞: 一個低嚴重性的缺陷,計劃在 6 月底隨 curl 8.21.0 發布時進行 CVE 發布。

除了漏洞之外,AI 還識別了大約二十個 bug。雖然這些不是安全缺陷,但它們被清晰地描述,並且正在被修復中。

AI 炒作 vs. 技術現實

基於這些結果,Stenberg 總結出 Mythos 周圍的「好得危險」的敘事主要是行銷手段。他沒有發現任何證據表明 Mythos 識別問題的程度比之前的 AI 工具顯著更高或更先進。事實上,curl 專案使用的其他 AI 驅動工具——例如 AISLE、Zeropath 和 OpenAI 的 Codex Security——先前已觸發了兩百到三百個 bug 修復,包括十幾個或更多的已確認 CVE。

然而,這並不意味著 AI 是無效的。Stenberg 強調,AI 驅動的程式碼分析器比傳統的靜態分析器要顯著更好。大型語言模型(LLM)在安全審計中的價值在於其能力:

  • 上下文感知: 發現註釋聲稱程式碼的功能與程式碼實際功能之間的差異。
  • 跨平台分析: 檢查程式碼在傳統環境中難以運行的平台和配置。
  • API 與協定知識: 利用對第三方函式庫和協定規範的「知識」來檢測錯誤的假設或違規行為。
  • 溝通: 以一種遠比舊式分析器更不乏味的方式來總結和解釋缺陷。
  • 修復: 為識別出的問題生成潛在的補丁。

對軟體安全的更廣泛影響

雖然 Mythos 可能沒有「攻破」curl curl,但更廣泛的教訓是,AI 驅動的掃描現在已成為一種必要。所謂的「高品質混沌」——研究人員使用 AI 產生的海量高品質安全報告——已成為現實。

正如一位社群成員在 Hacker News 的討論中提到的,curl 的高度審計事實意味著 Mythos 有限的發現並非反映了模型的弱點,而是證明了 curl 的成熟度。對於大多數尚未使用 AI 掃描的軟體專案,結果可能會令人震驚。

"Not using AI code analyzers in your project means that you leave adversaries and attackers time and opportunity to find and exploit the flaws you don’t find."

結論

AI 並非透過發現全新的漏洞類型來重塑安全領域;相反地,它在尋找已建立的錯誤類型的新實例時效率極高。對於像 curl 一樣精煉的專案,收益是微小的。對於軟體生態系統的其餘部分,AI 驅動的分析是關鍵的防禦層,再也無法被忽視。

Sources