OpenAI 推出 EVMbench
OpenAI 與 Paradigm 已推出 EVMbench,一項衡量 AI 代理偵測、修補與利用高嚴重性智慧合約漏洞能力的基準測試。此工具讓研究人員能追蹤新興的網路風險,並鼓勵以防禦性方式使用 AI 來稽核與加固保護數十億加密資產的智慧合約。
EVMbench 資料集與環境
EVMbench 由 117 個精選漏洞組成,來源於 40 次稽核,主要來自開放程式碼稽核競賽。此基準測試亦納入來自 Tempo 區塊鏈安全稽核流程的漏洞情境,Tempo 為一個為高吞吐量、低成本穩定幣支付而設計的 Layer 1,藉此使基準測試根植於以支付為導向的智慧合約程式碼。
為確保可重現且客觀的評估,OpenAI 開發了一個基於 Rust 的測試框架,具備以下特性:
- Isolated Execution: 隔離執行:利用漏洞任務在本機 Anvil 環境中執行,而非在實際網路上。
- Deterministic Replay: 確定性重放:測試框架會部署合約並確定性地重放代理的交易。
- Security Constraints: 安全限制:系統限制不安全的 RPC 方法,以維持環境完整性。
- Task Validation: 任務驗證:環境是透過改編現有概念驗證漏洞與部署腳本建立的,並由 Paradigm 以及自動化任務稽核代理提供額外品質控制。
評估模式與模型表現
EVMbench 以三種不同的能力模式評估 AI 代理:
偵測
代理會稽核智慧合約儲存庫,並根據對真實漏洞的召回率以及相關稽核獎勵進行評分。此模式的表現目前受限,因為代理有時在發現單一問題後即停止,而非執行完整的稽核。
修補
代理必須修改易受攻擊的合約,以消除可利用性,同時保留預期功能。成功與否透過自動化測試與漏洞檢查驗證。於當前模型而言,在移除細微漏洞的同時維持完整功能仍是一大挑戰。
利用
代理在沙盒環境中對已部署的合約執行端對端的資金抽取攻擊。評分透過交易重放與鏈上驗證以程式化方式進行。
在利用模式中,GPT-5.3-Codex(透過 Codex CLI)取得 71.0% 的分數,相較於約六個月前的 GPT-5(得分 33.3%)有顯著提升。
基準測試的限制
EVMbench 未能涵蓋真實世界智慧合約安全的全部複雜性。主要限制包括:
- Scope of Vulnerabilities: 漏洞範圍:漏洞取自 Code4rena 競賽;大量部署的合約通常接受更嚴格的審查,且可能較難被利用。
- Grading Constraints: 評分限制:在「偵測」模式下,系統目前無法判斷代理發現的人類稽核未察覺的漏洞是正確正例還是偽陽性。
- Structural Constraints: 結構限制:利用設定使用乾淨的本機 Anvil 實例,而非主網分叉,且交易依序重放,意味著依賴精確時序機制的行為不在範圍內。
- Environment Limits: 環境限制:此基準測試目前僅支援單鏈環境,因而在某些情況下必須使用模擬合約。
防禦性倡議與網路安全防護
由於網路安全能力具備雙重用途,OpenAI 正採取基於證據的方法,以加速防禦同時減緩濫用。相關措施包括:
- Technical Mitigations: 技術緩解措施:使用安全訓練、自動化監控、威脅情報執行管線,以及對高階功能的受信任存取。
- Ecosystem Support: 生態系統支援:擴大 Aardvark(安全研究代理)的私有測試版,並為廣泛使用的開源專案提供免費程式碼掃描。
- Financial Commitment: 財務承諾:OpenAI 透過其網路安全補助計畫提供 1,000 萬美元的 API 點數,以支援從事善意安全研究的開源軟體與關鍵基礎設施系統。
Sources
- OriginalIntroducing EVMbench