facebookresearch/ProgramBench
Can Language Models Rebuild Programs From Scratch?
해결하는 문제
ProgramBench는 AI 에이전트가 컴파일된 바이너리와 그 문서만을 가지고 완전한 코드베이스를 처음부터 재구성할 수 있는지 평가할 수 있는 벤치마크를 제공합니다. 모델이 바이너리와 문서만을 이용해 원래 바이너리의 동작을 재현하는 프로그램을 설계하고 구현할 수 있는 능력을 테스트합니다.
작동 방식
이 프로젝트는 AI 에이전트가 프로그램을 재구성해보도록 하는 테스트 세트와 프레임워크를 제공합니다. 에이전트는 컴파일된 바이너리와 문서를 받고, 원래 프로그램의 기능과 일치하는 코드베이스를 생성해야 합니다.
대상 사용자
이 도구는 AI 에이전트, 특히 소프트웨어 공학 및 코드 생성 능력에 초점을 맞춘 연구자 및 개발자를 위한 것입니다.
주요 특징
- 처음부터 프로그램을 재구성하는 벤치마크.
- 에이전트 성능을 추적하는 랭킹 보드 포함.
mini-swe-agent베이스라인과 통합됨.- pip 또는 uv를 통해 Python 패키지로 제공됨.
관련
- Dispatch
- Dispatch
- 프로젝트
- Dispatch
- 프로젝트