Linzwcs/EvoPolicyGym

EvoPolicyGym is infrastructure for evaluating coding agents and generating training experience through Autonomous Policy Evolution.

解决的问题

EvoPolicyGym 解决了传统代码基准仅评估最终答案的局限性。它提供了一个框架,用于评估代码代理如何通过迭代实验、从反馈中学习,并在交互式环境中逐步演化出可执行策略(即策略)来解决复杂任务。

工作原理

该系统在代理、工作区和服务器之间形成一个循环。代理编辑一个策略程序(定义 make_policy 函数的 Python 文件),提交执行一组剧集,并接收公开反馈。

关键机制包括:

  • 预算化实验:代理被分配一个固定的剧集预算,用于在探索和确认策略之间分配资源。
  • 标准化接口:将多种环境(如 NetHack、Balatro 和 Gymnasium)统一到一个共同的基准契约下。
  • 评估生命周期:流程从使用预算的主动实验开始,过渡到对保留剧集的私有验证和最终评估,以确保泛化能力。
  • 主机控制:主机管理剧集池、预算和最终选择,防止代理对特定种子过拟合。

适用人群

  • AI 研究人员:研究自主策略演化以及代理如何从有限反馈中学习的研究者。
  • 代码代理开发者:使用 Claude Code、Codex 等工具构建代理,希望观察其如何随时间改进可执行策略的开发者。
  • 基准作者:希望使用提供的编写 API 创建标准化交互式环境基准的用户。

主要亮点

  • 广泛环境支持:支持 ARC Prize、AtCoder、Crafter、DeepMind Control Suite、Gymnasium(Box2D、MuJoCo、Toy Text)、MiniGrid、NetHack(NLE)等。
  • 代理集成:提供 Codex、Claude Code、Kimi Code 和 Qoder 的官方 CLI 集成。
  • 强调泛化能力:特别衡量代理在未见剧集上的泛化能力,而不仅仅是解决单个实例。
  • **FileNotFound: 当前 alpha 版本中无沙箱隔离(ProcessExecution 不是沙箱)。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目