Linzwcs/EvoPolicyGym
EvoPolicyGym is infrastructure for evaluating coding agents and generating training experience through Autonomous Policy Evolution.
解決的問題
EvoPolicyGym 解決了傳統代碼基準僅評估最終答案的限制。它提供了一個框架,用於評估代碼代理如何透過迭代實驗、從反饋中學習,並在互動式環境中逐步演化出可執行策略(即策略)來解決複雜任務。
工作原理
該系統在代理、工作區和伺服器之間形成一個循環。代理編輯一個策略程式(定義 make_policy 函數的 Python 檔案),提交執行一組劇集,並接收公開反饋。
關鍵機制包括:
- 預算化實驗:代理被分配一個固定的劇集預算,用於在探索和確認策略之間分配資源。
- 標準化介面:將多種環境(如 NetHack、Balatro 和 Gymnasium)統一到一個共同的基準契約下。
- 評估生命週期:流程從使用預算的主動實驗開始,過渡到對保留劇集的私有驗證和最終評估,以確保泛化能力。
- 主機控制:主機管理劇集池、預算和最終選擇,防止代理對特定種子過度擬合。
適用對象
- AI 研究人員:研究自主策略演化以及代理如何從有限反饋中學習的研究者。
- 代碼代理開發者:使用 Claude Code、Codex 等工具建構代理,希望觀察其如何隨時間改進可執行策略的開發者。
- 基準作者:希望使用提供的撰寫 API 建立標準化互動式環境基準的使用者。
主要亮點
- 廣泛環境支援:支援 ARC Prize、AtCoder、Crafter、DeepMind Control Suite、Gymnasium(Box2D、MuJoCo、Toy Text)、MiniGrid、NetHack(NLE)等。
- 代理整合:提供 Codex、Claude Code、Kimi Code 和 Qoder 的官方 CLI 整合。
- 強調泛化能力:特別衡量代理在未見劇集上的泛化能力,而不仅仅是解決單一實例。
- **FileNotFound: 當前 alpha 版本中無沙箱隔離(ProcessExecution 不是沙箱)。
相關
- 專案
- 專案
- 專案
- 專案
- 專案