paradigmxyz/evmbench

Collab with OpenAI. A benchmark and harness for finding and exploiting smart contract bugs

它解決了什麼問題

evmbench 提供了一個結構化的環境,用於基準測試和部署旨在尋找和利用智能合約漏洞的 AI 代理。它彌合了原始 LLM 能力與安全、可重現的框架之間的差距,以評估這些代理在對不受信任的代碼執行安全審計方面的表現。

它是如何運作的

該系統以分散式架構運行,用戶通過 Next.js 前端上傳智能合約源代碼。FastAPI 後端使用 RabbitMQ 和 PostgreSQL 管理作業隊列。然後,一個「Instancer」服務啟動隔離的工作容器(通過 Docker 或 Kubernetes)來執行審計。

在這些工作容器內部,一個 LLM 驅動的代理(使用 Codex)以「僅檢測」模式運行。該代理根據特定的提示和模型映射分析代碼,生成 JSON 格式的漏洞報告,並將結果上傳到結果服務,用戶可以通過 UI 查看這些結果。

適用對象

安全研究人員、智能合約審計師和 AI 開發人員,他們希望評估基於 LLM 的代理在識別智能合約漏洞方面的有效性。

亮點

  • 隔離執行:使用 Docker/K8s 工作容器將運行環境視為不受信任,保護主機系統免受潛在惡意上傳代碼的影響。
  • 代理框架:整合特定的提示和模型映射系統,以標準化代理的測試方式。
  • 靈活的憑證管理:支持直接 API 密鑰使用(BYOK)和代理令牌模式,以將明文密鑰保留在工作容器環境之外。
  • 全棧工具:包括從文件上傳、作業排隊到結果渲染和註釋的完整管道。

相關

  • 專案
  • 專案
  • 專案
  • 專案