paradigmxyz/evmbench
Collab with OpenAI. A benchmark and harness for finding and exploiting smart contract bugs
它解决了什么问题
evmbench 提供了一个结构化的环境,用于基准测试和部署旨在寻找和利用智能合约漏洞的 AI 代理。它弥合了原始 LLM 能力与安全、可重现的框架之间的差距,以评估这些代理在对不受信任的代码执行安全审计方面的表现。
它是如何运作的
该系统以分布式架构运行,用户通过 Next.js 前端上传智能合约源代码。FastAPI 后端使用 RabbitMQ 和 PostgreSQL 管理作业队列。然后,一个“Instancer”服务启动隔离的工作容器(通过 Docker 或 Kubernetes)来执行审计。
在这些工作容器内部,一个 LLM 驱动的代理(使用 Codex)以“仅检测”模式运行。该代理根据特定的提示和模型映射分析代码,生成 JSON 格式的漏洞报告,并将结果上传到结果服务,用户可以通过 UI 查看这些结果。
适用对象
安全研究人员、智能合约审计师和 AI 开发人员,他们希望评估基于 LLM 的代理在识别智能合约漏洞方面的有效性。
亮点
- 隔离执行:使用 Docker/K8s 工作容器将运行环境视为不受信任,保护主机系统免受潜在恶意上传代码的影响。
- 代理框架:整合特定的提示和模型映射系统,以标准化代理的测试方式。
- 灵活的凭证管理:支持直接 API 密钥使用(BYOK)和代理令牌模式,以将明文密钥保留在工作容器环境之外。
- 全栈工具:包括从文件上传、作业排队到结果渲染和注释的完整管道。
相关
- 项目
- 项目
- 项目
- 项目