Anthropic 為網路防禦者打造 AI
Anthropic 已開發出 Claude Sonnet 4.5,特別著重於增強其為防禦者提供的網路安全能力,使該模型在發現程式碼漏洞方面的表現能與較大的 Claude Opus 4.1 媲美甚至超越。這一轉變反映了一個轉折點,即尖端 AI 越來越有能力執行進階的網路任務,因此有必要加速開發 AI 驅動的防禦工具,以維持與 AI 增強型攻擊者的對等地位。
Claude Sonnet 4.5 中增強的網路能力
Claude Sonnet 4.5 的開發是透過將研究專注於關鍵防禦技能(例如程式碼漏洞發現與修補),而非僅僅依賴通用的模型規模擴展。雖然網路安全技能通常是通用訓練的副產品,但 Anthropic 專注於這些領域,以確保防禦者配備了比以往的尖端模型更快且成本更低的更高效能工具。
Cybench 的表現
在利用基於 Capture-the-Flag (CTF) 挑戰的基準測試 Cybench 進行評估時,Claude Sonnet 4.5 展現了較先前版本顯著的進步:
- 成功率: 在每個任務給予 10 次嘗試機會時,Sonnet 4.5 達到了 76.5% 的成功率,是 Sonnet 3.7(2025 年 2 月發佈)35.9% 成功率的兩倍以上。
- 效率: Sonnet 4.5 在單次嘗試中能達到比 Opus 4.1 在十次嘗試中更高的成功機率。
- 複雜工作流: 該模型成功在 38 分鐘內解決了一個涉及網路流量分析、惡意軟體提取與解密的高複雜度任務——這項任務估計需要熟練的人類至少一小時。
CyberGym 的表現
使用測試開源軟體中已知與新漏洞發現能力的 CyberGym 基準測試,Claude Sonnet 4.5 創下了新的效能紀錄:
- 已知漏洞: 在每個漏洞限制 $2 的 API 查詢額度時,Sonnet 4.5 達到了 28.9% 的尖端水準分數。當移除限制並允許 30 次嘗試時,成功率上升至 66.7%。
- 新漏洞發現: Sonnet 4.5 在單次嘗試中,在 5% 的案例中發現了新漏洞,當給予 30 次嘗試時,發現比例增加到超過 33% 的專案。這與 Sonnet 4 相比有顯著提升,後者在約 2% 的目標中發現了漏洞。
自動化修補研究
Anthropic 正在針對該模型生成與審查修補程式以修復漏洞的能力進行初步研究。修補被認為是一項比發現漏洞更困難的任務,因為它需要在沒有明確規範的情況下,進行精確的變更以保留原始功能。
初步實驗顯示,Claude Sonnet 4.5 生成的修補程式中有 15% 被判定為在語義上與人類撰寫的參考修補程式等價。手動分析確認,其中一些得分最高的修補程式在功能上與併入開源軟體中的程式碼完全相同,這表明修補程式生成是一種湧現能力,可以透過專注的研究進一步精換。
真實世界應用與產業回饋
Anthropic 與安全組織合作,在真實世界的挑戰中測試 Claude Sonnet 4.5。關鍵回饋包括:
HackerOne: 回報稱 Claude Sonnet 4.5 為其 Hai 安全代理人減少了 44% 的平均漏洞攝入時間,同時將準確度提升了 25%。
CrowdStrike: 指出該模型在紅隊演練 (red teaming) 與生成創意攻擊情境方面具有潛力,能加速對跨端點、身分識別、雲端與 AI 工作負載中攻擊者技術的研習。
網路安全戰略戰略意義
Anthropic 指出,組織需要採用 AI 進行防禦,以避免將優勢讓給惡意行為者。這點可以從威脅行為者使用 AI 進行大規模數據勒索與針對關鍵電信基礎設施的複雜間諜活動(其中部分與中國 APT 操作相關)的破壞行為中得到證實。
為了應對此,Anthropic 建議將 AI 整合至 CI/CD 流水線中進行自動化安全審查,並擴大其在安全營運中心 (SOC) 自動化、安全資訊與事件管理 (SIEM) 分析以及主動防禦中的應用。目標是將 AI 在網路安全中的角色,從未來的擔憂轉變為當前必須透過設計來確保數位基礎設施安全的必要任務。
Sources
- OriginalBuilding AI for cyber defenders
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch