Linzwcs/EvoPolicyGym

EvoPolicyGym is infrastructure for evaluating coding agents and generating training experience through Autonomous Policy Evolution.

何を解決するか

EvoPolicyGym は、従来のコードベンチマークが最終的な答えのみを評価するという限界を克服します。代わりに、コードエージェントが反復的な実験、フィードバックからの学習、そしてインタラクティブ環境での複雑なタスクを解決するための実行可能なポリシー(戦略)を進化させるプロセスを評価するフレームワークを提供します。

動作方法

このシステムは、エージェント、ワークスペース、サーバーの間でループを形成します。エージェントはポリシープログラム(make_policy 関数を定義する Python ファイル)を編集し、エピソードのセットに対して実行を依頼し、公開されたフィードバックを受け取ります。

主なメカニズムは以下の通りです:

  • 予算付き実験:エージェントには、戦略の探索と確認に割り当てる固定エピソード予算が与えられます。
  • 標準化インターフェース:NetHack、Balatro、Gymnasium など多様な環境を、共通のベンチマーク契約の下に統合します。
  • 評価ライフサイクル:予算を使用した積極的な実験から始まり、保留されたエピソードでのプライベート検証と最終評価へと移行し、一般化能力を確保します。
  • ホスト制御:ホストがエピソードプール、予算、最終選定を管理することで、エージェントが特定のシードに過剰適合するのを防ぎます。

対象ユーザー

  • AI研究者:自律的なポリシー進化や、制限付きフィードバックから学ぶエージェントの研究に取り組む方。
  • コードエージェント開発者:Claude Code、Codex などのツールを使ってエージェントを開発し、時間とともに実行可能な戦略を改善できるかを検証したい方。
  • ベンチマーク作成者:提供されたアーティング API を使って、標準化されたインタラクティブ環境ベンチマークを作成したい方。

特徴

  • 広範な環境対応:ARC Prize、AtCoder、Crafter、DeepMind Control Suite、Gymnasium(Box2D、MuJoCo、Toy Text)、MiniGrid、NetHack(NLE)などへの統合を含む。
  • エージェント統合:Codex、Claude Code、Kimi Code、Qoder 用の公式 CLI 統合を提供。
  • 一般化重視:単一のインスタンスを解く能力ではなく、未確認のエピソードへの一般化能力を特に測定。
  • **FileNotFound: 現行アルファ版ではサンドボックス隔離なし(ProcessExecution はサンドボックスではない)。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト