Linzwcs/EvoPolicyGym

EvoPolicyGym is infrastructure for evaluating coding agents and generating training experience through Autonomous Policy Evolution.

解決的問題

EvoPolicyGym 解決了傳統代碼基準僅評估最終答案的限制。它提供了一個框架,用於評估代碼代理如何透過迭代實驗、從反饋中學習,並在互動式環境中逐步演化出可執行策略(即策略)來解決複雜任務。

工作原理

該系統在代理、工作區和伺服器之間形成一個循環。代理編輯一個策略程式(定義 make_policy 函數的 Python 檔案),提交執行一組劇集,並接收公開反饋。

關鍵機制包括:

  • 預算化實驗:代理被分配一個固定的劇集預算,用於在探索和確認策略之間分配資源。
  • 標準化介面:將多種環境(如 NetHack、Balatro 和 Gymnasium)統一到一個共同的基準契約下。
  • 評估生命週期:流程從使用預算的主動實驗開始,過渡到對保留劇集的私有驗證和最終評估,以確保泛化能力。
  • 主機控制:主機管理劇集池、預算和最終選擇,防止代理對特定種子過度擬合。

適用對象

  • AI 研究人員:研究自主策略演化以及代理如何從有限反饋中學習的研究者。
  • 代碼代理開發者:使用 Claude Code、Codex 等工具建構代理,希望觀察其如何隨時間改進可執行策略的開發者。
  • 基準作者:希望使用提供的撰寫 API 建立標準化互動式環境基準的使用者。

主要亮點

  • 廣泛環境支援:支援 ARC Prize、AtCoder、Crafter、DeepMind Control Suite、Gymnasium(Box2D、MuJoCo、Toy Text)、MiniGrid、NetHack(NLE)等。
  • 代理整合:提供 Codex、Claude Code、Kimi Code 和 Qoder 的官方 CLI 整合。
  • 強調泛化能力:特別衡量代理在未見劇集上的泛化能力,而不仅仅是解決單一實例。
  • **FileNotFound: 當前 alpha 版本中無沙箱隔離(ProcessExecution 不是沙箱)。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案