OpenAI 推出 EVMbench

OpenAI 与 Paradigm 推出了 EVMbench,这是一项衡量 AI 代理检测、修补和利用高危智能合约漏洞能力的基准测试。该工具使研究人员能够跟踪新兴的网络风险,并鼓励将 AI 用于防御性审计和强化智能合约,以保护数十亿美元的加密资产。

EVMbench 数据集与环境

EVMbench 由 117 条精选漏洞组成,来源于 40 次审计,主要来自公开代码审计竞赛。该基准还纳入了 Tempo 区块链安全审计过程中的漏洞场景,Tempo 是一个为高吞吐量、低成本稳定币支付而设计的 Layer 1,旨在使基准基于面向支付的智能合约代码。

为确保可复现且客观的评估,OpenAI 开发了一个基于 Rust 的 harness,具备以下特性:

  • Isolated Execution: 利用任务在本地 Anvil 环境中运行,而非在真实网络上执行。
  • Deterministic Replay: harness 以确定性的方式部署合约并重放代理交易。
  • Security Constraints: 系统限制不安全的 RPC 方法,以维护环境完整性。
  • Task Validation: 环境通过改编现有概念验证漏洞和部署脚本创建,并由 Paradigm 提供额外的质量控制以及自动化任务审计代理进行验证。

评估模式与模型表现

EVMbench 在三种不同的能力模式下评估 AI 代理:

检测

代理审计智能合约仓库,并根据对真实漏洞的召回率以及相应的审计奖励进行评分。目前该模式的表现受限,因为代理有时在发现单个问题后就停止,而未进行全面审计。

修补

代理必须修改易受攻击的合约,以消除可利用性,同时保持预期功能。成功与否通过自动化测试和漏洞检查进行验证。保持完整功能的同时去除细微漏洞仍是当前模型面临的重大挑战。

利用

代理在沙盒环境中对已部署的合约执行端到端的资金抽取攻击。评分通过交易重放和链上验证以程序化方式完成。

在利用模式下,GPT-5.3-Codex(通过 Codex CLI)取得了 71.0% 的得分,相较约六个月前的 GPT-5(得分 33.3%)有了显著提升。

基准的局限性

EVMbench 并未涵盖真实世界智能合约安全的全部复杂性。主要局限包括:

  • Scope of Vulnerabilities: 漏洞来源于 Code4rena 竞赛;大量部署的合约通常接受更严格的审查,可能更难被利用。
  • Grading Constraints: 在“检测”模式下,系统目前无法判断代理发现的人类审计员未发现的漏洞是正例还是误报。
  • Structural Constraints: 利用设置使用干净的本地 Anvil 实例而非主网分叉,并顺序重放交易,这意味着依赖精确时序机制的行为不在评估范围内。
  • Environment Limits: 基准目前仅支持单链环境,某些情况下需要使用模拟合约。

防御性举措与网络安全保障

由于网络安全能力具有双重用途,OpenAI 正在实施基于证据的方法,以加速防御并减缓滥用。这些工作包括:

  • Technical Mitigations: 使用安全训练、自动化监控、威胁情报执法流水线以及对高级能力的可信访问。
  • Ecosystem Support: 扩大 Aardvark(安全研究代理)的私有 beta,并为广泛使用的开源项目提供免费代码库扫描。
  • Financial Commitment: OpenAI 通过其网络安全资助计划提供 1000 万美元的 API 额度,以支持从事善意安全研究的开源软件和关键基础设施系统。

Sources