OpenAI가 EVMbench를 소개합니다

OpenAI와 Paradigm은 고위험 스마트 계약 취약점을 탐지, 패치 및 악용하는 AI 에이전트의 능력을 측정하는 벤치마크인 EVMbench를 발표했습니다. 이 도구는 연구자들이 새로운 사이버 위험을 추적하도록 돕고, 수십억 달러 규모의 암호 자산을 보호하는 스마트 계약을 감사하고 강화하기 위해 AI를 방어적으로 활용하도록 장려합니다.

EVMbench 데이터셋 및 환경

EVMbench는 40개의 감사를 통해 선별된 117개의 취약점으로 구성되며, 주로 공개 코드 감사 대회에서 수집되었습니다. 또한 이 벤치마크는 고처리량·저비용 스테이블코인 결제를 위해 설계된 레이어 1 블록체인인 Tempo의 보안 감사 과정에서 나온 취약 시나리오를 포함하여, 결제 중심 스마트 계약 코드를 기반으로 합니다.

재현 가능하고 객관적인 평가를 보장하기 위해 OpenAI는 다음과 같은 특성을 가진 Rust 기반 하네스를 개발했습니다:

  • Isolated Execution: 익스플로잇 작업은 실시간 네트워크가 아닌 로컬 Anvil 환경에서 실행됩니다.
  • Deterministic Replay: 하네스는 계약을 배포하고 에이전트 트랜잭션을 결정론적으로 재생합니다.
  • Security Constraints: 시스템은 환경 무결성을 유지하기 위해 위험한 RPC 메서드를 제한합니다.
  • Task Validation: 기존 개념 증명 익스플로잇 및 배포 스크립트를 적용해 환경을 만들었으며, Paradigm과 자동화된 작업 감사 에이전트가 추가 품질 관리를 제공합니다.

평가 모드 및 모델 성능

EVMbench는 AI 에이전트를 세 가지 별도 역량 모드에서 평가합니다:

탐지

에이전트는 스마트 계약 저장소를 감사하고, 실제 취약점 회수율 및 관련 감사 보상에 따라 점수를 부여받습니다. 현재 이 모드의 성능은 제한적이며, 에이전트가 단일 이슈만 발견하고 전체 감사를 수행하지 않는 경우가 종종 있습니다.

패치

에이전트는 취약한 계약을 수정해 악용 가능성을 제거하면서 의도된 기능을 유지해야 합니다. 성공 여부는 자동화된 테스트와 익스플로잇 검증을 통해 확인됩니다. 미묘한 취약점을 제거하면서 전체 기능을 보존하는 것은 현재 모델에게 큰 도전 과제입니다.

익스플로잇

에이전트는 샌드박스 환경에서 배포된 계약에 대해 자금 탈취 공격을 수행합니다. 채점은 트랜잭션 재생 및 온체인 검증을 통해 프로그래밍 방식으로 이루어집니다.

익스플로잇 모드에서 GPT-5.3-Codex (via Codex CLI) 가 71.0% 점수를 달성했으며, 이는 약 6개월 전 33.3% 점수를 기록한 GPT-5에 비해 크게 향상된 결과입니다.

벤치마크의 한계

EVMbench는 실제 스마트 계약 보안의 복잡성을 완전히 포착하지 못합니다. 주요 제한 사항은 다음과 같습니다:

  • Scope of Vulnerabilities: 취약점은 Code4rena 대회에서 추출되었으며, 널리 배포된 계약은 더 많은 검증을 거쳐 악용이 어려울 수 있습니다.
  • Grading Constraints: ‘탐지’ 모드에서는 인간 감사자가 놓친 취약점을 에이전트가 발견했을 때 이를 진양성인지 위양성인지 판단할 수 없습니다.
  • Structural Constraints: 익스플로잇 설정은 메인넷 포크가 아닌 깨끗한 로컬 Anvil 인스턴스를 사용하고 트랜잭션을 순차적으로 재생하므로, 정확한 타이밍 메커니즘에 의존하는 행동은 범위에 포함되지 않습니다.
  • Environment Limits: 현재 벤치마크는 단일 체인 환경만 지원하므로, 일부 경우에 모의 계약을 사용해야 합니다.

방어적 이니셔티브 및 사이버 보호조치

사이버 보안 역량은 이중 용도이기 때문에, OpenAI는 방어를 가속화하고 악용을 늦추기 위한 증거 기반 접근 방식을 구현하고 있습니다. 주요 노력은 다음과 같습니다:

  • Technical Mitigations: 안전 교육, 자동 모니터링, 위협 인텔리전스 집행 파이프라인, 고급 기능에 대한 신뢰된 접근을 활용합니다.
  • Ecosystem Support: 보안 연구 에이전트인 Aardvark의 프라이빗 베타를 확대하고, 널리 사용되는 오픈소스 프로젝트에 대해 무료 코드베이스 스캔을 제공합니다.
  • Financial Commitment: OpenAI는 사이버 보안 지원 프로그램을 통해 API 크레딧 $10M을 제공하여, 선의의 보안 연구에 참여하는 오픈소스 소프트웨어와 핵심 인프라 시스템을 지원합니다.

SUMMARY: OpenAI와 Paradigm은 고위험 스마트 계약 취약점을 탐지, 패치 및 악용하는 AI 에이전트의 능력을 평가하도록 설계된 벤치마크인 EVMbench를 출시했습니다.

TITLE: OpenAI가 EVMbench를 소개합니다

Sources