ByteDance-Seed/EdgeBench
EdgeBench: Unveiling scaling laws of learning from real-world environments
해결하는 문제
EdgeBench는 AI 에이전트의 일회성 성능 벤치마크의 한계를 해결합니다. 단일 시도를 측정하는 것이 아니라, 실제 환경과의 반복적 상호작용을 통해 장기간(각 작업당 최대 12시간 이상)에 걸쳐 학습하고 개선하는 능력을 평가하며, 최종 결과뿐만 아니라 개선의 흐름을 추적합니다.
작동 방식
EdgeBench는 과학 및 머신러닝, 시스템 및 소프트웨어공학, 최적화, 지식, 형식적, 게임의 6개 범주에 걸쳐 134개의 실제 작업을 포함하며, 그 중 51개 작업은 공개되어 있습니다. 전용 평가 허브인 SForge를 사용하며, 에이전트가 작동하는 "작업" 컨테이너와 테스트가 실행되는 숨겨진 "심사" 컨테이너로 구성된 이중 컨테이너 격리 시스템을 채택합니다. 에이전트는 제출물에 대해 세부적인 피드백을 받으며, 타임아웃이 발생할 때까지 닫힌 루프에서 반복할 수 있습니다.
대상 사용자
자율적인 AI 에이전트를 개발하고 연구하는 연구자 및 개발자에게 적합합니다. 모델이 환경 피드백에서 어떻게 학습하고 시간이 지남에 따라 성능을 확장하는지 측정하고자 하는 분들께 추천합니다.
주요 특징
- 장기적 평가: 작업당 12시간 이상에 걸쳐 에이전트의 진전을 추적합니다.
- 이중 컨테이너 격리: 작업 환경과 심사 환경을 분리하여 평가 조작을 방지합니다.
- 스케일링 법칙 발견: 에이전트 성능이 상호작용 시간에 대해 로그-시그모이드 스케일링 법칙을 따른다는 것을 발견했습니다.
- SForge 허브: Kubernetes 백엔드 지원을 통해 대규모 에이전트 평가를 실행할 수 있는 확장 가능한 프레임워크입니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트