sunblaze-ucb/exploitgym

ExploitGym is a large-scale, realistic benchmark built from real-world vulnerabilities designed to evaluate AI agents' ability to develop exploits.

解決的問題

ExploitGym 提供了一個標準化的、大規模的基準測試,用於評估 AI 代理從真實的安全漏洞中開發功能性漏洞利用程式的能力。它解決了衡量代理將漏洞轉化為成功攻擊的能力所需的現實測試環境的需求。

工作原理

該系統使用基於使用者空間程式、Linux 核心和 Google V8 引擎中發現的真實漏洞的 869 個實例集合。它採用控制器、用於出站網路隔離的防火牆以及 LLM 代理來管理 AI 代理的執行。代理與包含特定漏洞的目標 Docker 鏡像進行互動,嘗試獲取預期的 flag。

適用對象

該工具專為從事網路安全和漏洞利用開發背景下 AI 代理能力與安全性研究的安全研究人員和 AI 開發人員設計。

亮點

  • 真實世界數據:基於 Linux 核心、V8 引擎和使用者空間程式中的實際漏洞構建。
  • 大規模:1.0 版本包含 869 個不同的基準測試實例。
  • 隔離環境:使用 Docker 和專用防火牆確保代理容器在網路中處於隔離狀態。
  • 全面的工具鏈:包括控制器和 LLM 代理,以促進對 AI 代理的評估。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案