Linzwcs/EvoPolicyGym

EvoPolicyGym is infrastructure for evaluating coding agents and generating training experience through Autonomous Policy Evolution.

해결하는 문제

EvoPolicyGym은 기존 코드 벤치마크가 최종 답변만 평가한다는 한계를 해결합니다. 대신, 코드 에이전트가 반복적인 실험, 피드백을 통한 학습, 그리고 인터랙티브 환경에서 복잡한 작업을 해결하기 위한 실행 가능한 정책(전략)을 어떻게 진화시키는지 평가할 수 있는 프레임워크를 제공합니다.

작동 방식

시스템은 에이전트, 워크스페이스, 서버 간의 루프로 작동합니다. 에이전트는 정책 프로그램(예: make_policy 함수를 정의하는 Python 파일)을 편집하고, 일련의 에피소드에 대해 실행을 제출한 후 공개된 피드백을 수신합니다.

핵심 메커니즘은 다음과 같습니다:

  • 예산 기반 실험: 에이전트는 전략 탐색과 확인에 할당할 수 있는 고정된 에피소드 예산을 제공받습니다.
  • 표준화된 인터페이스: NetHack, Balatro, Gymnasium 등 다양한 환경을 공통의 벤치마크 계약 아래 통합합니다.
  • 평가 라이프사이클: 예산을 사용한 적극적인 실험에서 시작하여, 보류된 에피소드에서 사적 검증과 최종 평가로 이어져 일반화를 보장합니다.
  • 호스트 제어: 호스트는 에피소드 풀, 예산, 최종 선택을 관리하여 에이전트가 특정 시드에 과적합되는 것을 방지합니다.

대상 사용자

  • AI 연구자: 자율적인 정책 진화와 제한된 피드백을 통해 학습하는 에이전트에 관심 있는 연구자.
  • 코드 에이전트 개발자: Claude Code, Codex 등으로 에이전트를 개발하고, 시간이 지남에 따라 실행 가능한 전략을 어떻게 개선할 수 있는지 확인하고 싶은 개발자.
  • 벤치마크 작성자: 제공된 작성 API를 사용해 표준화된 인터랙티브 환경 벤치마크를 만들고 싶은 사용자.

주요 특징

  • 광범위한 환경 지원: ARC Prize, AtCoder, Crafter, DeepMind Control Suite, Gymnasium (Box2D, MuJoCo, Toy Text), MiniGrid, NetHack (NLE) 등과의 통합 포함.
  • 에이전트 통합: Codex, Claude Code, Kimi Code, Qoder용 공식 CLI 통합 제공.
  • 일반화 중심: 단일 인스턴스를 해결하는 능력이 아니라, 미리 보지 못한 에피소드에 일반화할 수 있는 능력을 특히 측정.
  • **FileNotFound: 현재 알파 버전에서는 사전 격리 없음 (ProcessExecution은 사전이 아님).

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트