paradigmxyz/evmbench

Collab with OpenAI. A benchmark and harness for finding and exploiting smart contract bugs

解決する問題

evmbench は、スマートコントラクトの脆弱性を見つけて悪用するように設計されたAIエージェントをベンチマークし、展開するための構造化された環境を提供します。これは、生のLLM機能と、信頼できないコードに対してセキュリティ監査を実行する際のエージェントの性能を評価するための安全で再現可能なハーネスの実用的なニーズとの間のギャップを埋めます。

仕組み

このシステムは分散アーキテクチャとして動作し、ユーザーはNext.jsフロントエンドを介してスマートコントラクトのソースコードをアップロードします。FastAPIバックエンドは、RabbitMQとPostgreSQLを使用してジョブキューを管理します。次に、「Instancer」サービスが、監査を実行するために隔離されたワーカーコンテナ(DockerまたはKubernetes経由)を起動します。

これらのワーカー内では、LLM駆動エージェント(Codexを使用)が「検出のみ」モードで実行されます。エージェントは特定のプロンプトとモデルマップに基づいてコードを分析し、JSON形式の脆弱性レポートを生成して、結果サービスにアップロードします。ユーザーはUIを介して結果を表示できます。

対象読者

スマートコントラクトのバグを特定する際のLLMベースのエージェントの有効性を評価したいセキュリティ研究者、スマートコントラクト監査人、AI開発者。

ハイライト

  • 隔離された実行:Docker/K8sワーカーを使用してランタイム環境を信頼できないものとして扱い、潜在的に悪意のあるアップロードコードからホストシステムを保護します。
  • エージェントハーネス:エージェントのテスト方法を標準化するために、特定のプロンプトとモデルマッピングシステムを統合します。
  • 柔軟な資格情報管理:直接APIキー使用(BYOK)と、ワーカー環境外に平文キーを保持するプロキシトークンモードの両方をサポートします。
  • フルスタックツール:ファイルアップロード、ジョブキューイングから結果のレンダリングと注釈までの完全なパイプラインが含まれます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト