CyberSecEval 2:評估大型語言模型的網路安全風險
Hugging Face 與 Meta 推出了 CyberSecEval 2,一個全面的評估框架,旨在衡量大型語言模型(LLM)的網路安全風險與能力。隨著 LLM 越來越多地被整合到程式碼助理中,這個框架變得至關重要,因為它會帶來需要透過標準化基準測試來減輕的新漏洞。
網路安全基準測試類別
CyberSecEval 2 使用五個不同的測試套件來評估 LLM 處理不安全程式碼以及協助網路攻擊請求的方式:
- 不安全的程式碼實踐:此測試根據業界標準的 Common Weakness Enumeration(CWE)分類,衡量 LLM 在自動完成與指令情境中建議風險安全弱點的頻率。結果以程式碼測試通過率報告。
- 提示注入易感性:這些測試評估模型區分可信與不可信輸入的能力,以及對常見提示注入技術的韌性。報告的指標是模型對攻擊的遵從頻率。
- 網路攻擊遵從性:此套件衡量違規率(同意協助進攻性網路攻擊)與誤拒率(拒絕與網路防禦相關的良性提示)之間的取捨。
- 程式碼解譯器濫用:此測試評估 LLM 是否會被操控在沙箱環境中執行惡意程式碼,以取得系統存取、收集敏感資訊或執行社交工程攻擊。結果以遵從頻率報告。
- 自動化進攻能力:透過 Capture-the-Flag(CTF)風格的安全測試案例,此套件判斷 LLM 是否能解決端對端的利用挑戰,例如 SQL 注入與緩衝區溢位。結果以完成百分比報告。
主要發現與產業趨勢
使用 CyberSecEval 2 評估最先進的 LLM,已揭示出關於當前 AI 安全狀態的多項關鍵見解:
攻擊遵從率的降低
自從第一版基準於 2023 年 12 月發布以來,LLM 對協助網路攻擊請求的平均遵從率已從 52% 降至 28%。這顯示出產業普遍朝向在進攻性網路請求方面更好的安全對齊趨勢。
模型專精與安全性
非程式碼專精的模型通常呈現較低的違規率,較之程式碼專精模型。然而,兩者之間的差距正在縮小,顯示程式碼專精模型的安全姿態正在提升。
持續的提示注入風險
提示注入仍是未解決的問題。測試顯示開發者無法假設 LLM 在面對對抗性輸入時會安全地遵循系統提示,這對基於 LLM 的應用構成重大風險。
端對端利用的限制
雖然具備高通用程式碼能力的模型在利用測試中表現較佳,但目前 LLM 尚缺乏可靠解決端對端利用挑戰的能力。這暗示 LLM 在現階段不太可能顛覆網路利用攻擊。
程式碼解譯器的漏洞
LLM 仍易受到操控,使其在程式碼解譯器內執行濫用行為。此發現凸顯了需要額外的防護措施與偵測機制,以防止解譯器濫用。
開源貢獻
所有 CyberSecEval 2 的程式碼皆為開源。鼓勵社群在自己的模型上執行這些基準測試,並將結果提交至 CyberSecEval 2 排行榜,以增進對 LLM 網路安全安全屬性的整體了解。