paradigmxyz/evmbench

Collab with OpenAI. A benchmark and harness for finding and exploiting smart contract bugs

해결하는 문제

evmbench는 스마트 계약의 취약점을 찾고 악용하도록 설계된 AI 에이전트를 벤치마킹하고 배포하기 위한 구조화된 환경을 제공합니다. 이는 원시 LLM 기능과 신뢰할 수 없는 코드에 대한 보안 감사를 수행할 때 이러한 에이전트의 성능을 평가하기 위한 안전하고 재현 가능한 하네스의 실용적 필요성 사이의 격차를 해소합니다.

작동 방식

이 시스템은 분산 아키텍처로 작동하며, 사용자는 Next.js 프런트엔드를 통해 스마트 계약 소스 코드를 업로드합니다. FastAPI 백엔드는 RabbitMQ와 PostgreSQL을 사용하여 작업 대기열을 관리합니다. 그런 다음 "Instancer" 서비스가 감사를 실행하기 위해 격리된 작업자 컨테이너(Docker 또는 Kubernetes를 통해)를 시작합니다.

이 작업자 내부에서 LLM 기반 에이전트(Codex 사용)가 "감지 전용" 모드로 실행됩니다. 에이전트는 특정 프롬프트와 모델 맵을 기반으로 코드를 분석하고 JSON 형식의 취약점 보고서를 생성하여 결과 서비스에 업로드하며, 사용자는 UI를 통해 결과를 볼 수 있습니다.

대상 사용자

스마트 계약 버그 식별에서 LLM 기반 에이전트의 효과를 평가하려는 보안 연구원, 스마트 계약 감사자 및 AI 개발자.

주요 기능

  • 격리된 실행: Docker/K8s 작업자를 사용하여 런타임 환경을 신뢰할 수 없는 것으로 취급하여 잠재적으로 악의적인 업로드 코드로부터 호스트 시스템을 보호합니다.
  • 에이전트 하네스: 에이전트 테스트 방식을 표준화하기 위해 특정 프롬프트 및 모델 매핑 시스템을 통합합니다.
  • 유연한 자격 증명 관리: 직접 API 키 사용(BYOK)과 작업자 환경 외부에 평문 키를 유지하는 프록시 토큰 모드를 모두 지원합니다.
  • 풀스택 도구: 파일 업로드, 작업 대기열에서 결과 렌더링 및 주석에 이르는 완전한 파이프라인을 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트