sunblaze-ucb/exploitgym
ExploitGym is a large-scale, realistic benchmark built from real-world vulnerabilities designed to evaluate AI agents' ability to develop exploits.
解决的问题
ExploitGym 提供了一个标准化的、大规模的基准测试,用于评估 AI 智能体从真实的安全性漏洞中开发功能性漏洞利用程序的能力。它解决了衡量智能体将漏洞转化为成功攻击的能力所需的现实测试环境的需求。
工作原理
该系统使用基于用户空间程序、Linux 内核和 Google V8 引擎中发现的真实漏洞的 869 个实例集合。它采用控制器、用于出站网络隔离的防火墙以及 LLM 代理来管理 AI 智能体的执行。智能体与包含特定漏洞的目标 Docker 镜像进行交互,尝试获取预期的 flag。
适用对象
该工具专为从事网络安全和漏洞利用开发背景下 AI 智能体能力与安全性研究的安全研究人员和 AI 开发人员设计。
亮点
- 真实世界数据:基于 Linux 内核、V8 引擎和用户空间程序中的实际漏洞构建。
- 大规模:1.0 版本包含 869 个不同的基准测试实例。
- 隔离环境:使用 Docker 和专用防火墙确保智能体容器在网络中处于隔离状态。
- 全面的工具链:包括控制器和 LLM 代理,以促进对 AI 智能体的评估。
相关
- 项目
- 项目
- 项目
- 项目
- 项目