benchflow-ai/benchflow

Research infra for creating RL environments, post-training, and evals.

해결하는 문제

BenchFlow는 작업 환경에 대해 AI 에이전트를 실행하고 평가하기 위한 유니버설 프레임워크를 제공합니다. 벤치마크를 "고정된 환경"으로 간주하여 개발자가 다양한 벤치마크에서 ACP 에이전트를 단일 에이전트 또는 멀티에이전트 패턴으로 표준화된 계약을 기반으로 테스트할 수 있습니다.

작동 방식

BenchFlow는 Rollouts, Scenes, Roles, Verifiers로 구성된 3계층 모델을 사용합니다. 벤치마크 데이터셋은 외부 Git 리포지토리에서 가져올 수 있으며, 호스팅된 환경과도 연결할 수 있습니다. 프레임워크는 Docker, Daytona, Modal 등의 다양한 사전 환경을 지원하여 에이전트 실행을 격리합니다. 또한 로컬 코딩 에이전트 세션의 트래잭션(실행 로그)을 캡처하고 평가를 위해 업로드할 수도 있습니다.

대상 사용자

  • 평가 연구자 및 논문 작성자: 표준화된 평가를 수행해야 하는 분들
  • 작업 작성자: 새로운 벤치마크 작업 및 환경을 만드는 분들
  • 에이전트 개발자: BenchFlow 생태계에 자신의 에이전트를 통합하고 싶은 분들
  • 벤치마크 어댑터: 타사 벤치마크를 통합된 형식으로 도입하고 싶은 분들

주요 기능

  • 유니버설 호환성: Claude Code, Codex, Gemini CLI 등 다양한 에이전트 및 모델과 호환
  • 유연한 실행: 단일 에이전트, 멀티에이전트(예: 코더 + 리뷰어), 다중 라운드 패턴 및 점진적 공개 지원
  • 사전 환경 강화: Docker, Daytona, Modal과 통합되어 에이전트 실행의 보안 강화
  • 트래잭션 캡처: 비밀 정보를 마스킹하고 로컬 에이전트 세션의 트래잭션을 업로드하여 평가 가능
  • 작업 작성 도구: 벤치마크 작업의 스크래핑, 검증, 마이그레이션을 지원하는 CLI 제공

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트