sunblaze-ucb/cybergym

CyberGym is a large-scale, high-quality cybersecurity evaluation framework designed to rigorously assess the capabilities of AI agents on real-world vulnerability analysis tasks.

解決的問題

CyberGym 提供了一個標準化的規模化框架,用於評估 AI Agent 處理現實世界網路安全任務(特別是漏洞分析)的能力。它解決了大規模測試 AI Agent 是否能夠實際發現並利用軟體漏洞的嚴謹需求。

工作原理

該框架作為一個提交伺服器與任務生成系統運行。它提供了一個龐大的現實世界漏洞任務數據集(包括僅二進位環境與全編譯環境)。使用者為 AI Agent 生成特定任務,隨後 Agent 嘗試建立概念驗證(PoC)漏洞利用程式。Agent 將此 PoC 提交給本地伺服器,由伺服器驗證該漏洞利用是否成功觸發漏洞。為了確保安全性與公平性,CyberGym 內建了防火牆代理,將 Agent 容器的網際網路存取限制在預定義的允許網域清單中。

適用對象

構建網路安全 AI Agent 的研究人員與開發人員,特別是那些專注於自動化漏洞研究與漏洞利用生成的開發者。

亮點

  • 現實世界規模:包含源自真實漏洞的海量任務數據集。
  • 安全執行:具備專用防火牆與隔離的 Docker 網路,防止 Agent 存取公共網際網路。
  • 靈活部署:支援全編譯環境以及用於靜態分析任務的僅二進位模式。
  • 驗證系統:包含用於追蹤與驗證 Agent 提交之 PoC 的專用伺服器。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案