Anthropic 研究:衡量大型語言模型的漏洞開發能力
簡要重點
Anthropic 已評估 Claude Mythos Preview 的漏洞開發能力,發現其能夠在廣泛使用的軟體上構建完整的端到端攻擊鏈。這代表了與先前前沿模型相比的重大進步,顯示隨著這些能力變得更普遍,漏洞開發所需的專門知識將逐漸減少。
透過 ExploitBench 探測 V8 引擎
Claude Mythos Preview 是唯一能可靠逃脫 V8 沙箱並實現任意代碼執行(ACE)的測試模型。使用衡量五個層級(覆蓋範圍、重現、目標原語、通用原語、完整控制)中 16 種不同能力的 ExploitBench 框架,Mythos Preview 在 41 個測試的 CVE 中成功實現 ACE 的有 21 個。
V8 評估中的關鍵發現包括:
- 沙箱逃脫:雖然大多數模型能觸發漏洞,但 Mythos Preview 是唯一能穩定地從 T3(沙箱原語)進展到 T2(通用原語/沙箱逃脫)的模型。
- 穩定性與創新性:在一個案例(CVE-2023-6702)中,Mythos Preview 創建了一個近乎決定性的漏洞利用,而現有的公開漏洞利用則是概率性的。一位基準測試作者指出,該模型執行了一個複雜的漏洞利用計畫,人類研究人員曾因過於複雜而放棄。
- 性能差距:在基準測試的基線或 nudged 變體中,沒有其他模型能在不使用專有支架的情況下實現任何 ACE。
透過 ExploitGym 實現廣泛目標的漏洞利用
在使用 ExploitGym 進行的評估中,涵蓋了 OSS-Fuzz、V8 引擎和 Linux 核心中的 898 個已修補漏洞,Mythos Preview 展現出在實現未授權代碼執行方面的優異成功率。
- 成功率:Mythos Preview 在 157 個任務中成功利用預期漏洞實現未授權代碼執行,若包含替代漏洞路徑,總共成功捕獲 226 個旗幟。
- 對比:相比之下,Claude Opus 4.6 僅在預期漏洞上成功 15 次,總共捕獲 36 個旗幟。
- 核心漏洞利用:Mythos Preview 是僅有兩款被報告能頻繁開發核心漏洞的模型之一。
透過 SCONE-bench 探測智慧合約漏洞
使用更新的 SCONE-bench 資料集(包含 2026 年 1 月 1 日後報告的 12 個漏洞),Mythos Preview 在模擬環境中展現出極高的財務竊取能力。
- 財務影響:Mythos Preview 利用價值 3500 萬美元的智慧合約,比次近模型高出約 75%。
- 成功率:Mythos Preview 是唯一在基準測試中成功利用所有測試漏洞的模型。
- 成長趨勢:模型在智慧合約漏洞利用方面的性能提升週期,已從 Opus 4.5 之前的 1.1 個月加速至近期模型的 0.7 個月。
對人工智慧安全與部署的影響
Anthropic 結論認為,能在全球基礎設施上開發完整端到端漏洞的能力是一項關鍵能力,必須透過嚴謹且由專家主導的基準測試來應對。為降低這些風險,Anthropic 已實施多項措施:
- Project Glasswing:針對 Mythos Preview 採用受控發布策略,以防止高風險能力的全面釋出。
- Cyber Verification Program:一個系統,可在維持合法安全防禦者存取權的同時,阻擋可能的惡意網絡威脅。
- 外部研究者存取計畫:一項倡議,旨在支援網絡領域高品質、嚴謹的評估發展。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch