OpenAI PaperBench: AI 에이전트의 AI 연구 복제 능력 평가

TL;DR

OpenAI는 PaperBench를 도입했으며, 이는 AI 에이전트가 최신 AI 연구를 자율적으로 복제할 수 있는지를 평가하는 벤치마크입니다. 이는 에이전트가 복잡한 연구 논문을 이해하고, 처음부터 코드베이스를 개발하며, 실험을 성공적으로 수행하는 고급 AI 엔지니어링 역량을 테스트한다는 점에서 중요합니다.

PaperBench Benchmark Design

PaperBench는 AI 에이전트가 2024년 ICML Spotlight 및 Oral 논문 20편을 복제하는 능력을 평가합니다. 논문을 성공적으로 복제하려면 에이전트가 논문의 기여를 이해하고, 완전한 코드베이스를 개발하며, 결과를 재현하기 위해 실험을 실행할 수 있어야 합니다.

객관적인 평가를 위해 OpenAI는 각 복제 작업을 8,316개의 개별 채점 가능한 하위 작업으로 분해하는 루브릭을 개발했습니다. 이 루브릭은 ICML 논문의 원저자와 공동 개발되어 채점 기준의 정확성과 현실성을 확보했습니다.

Evaluation Framework and LLM-based Judging

확장 가능한 평가를 가능하게 하기 위해 OpenAI는 확립된 루브릭에 따라 복제 시도를 자동으로 채점하는 LLM 기반 판정을 구현했습니다. 이 자동 판정의 정확성을 검증하기 위해 팀은 판정 성능을 평가하기 위한 별도 벤치마크를 만들었습니다.

Performance Results

OpenAI는 여러 최첨단 모델을 PaperBench에 평가했습니다. 테스트된 가장 성능이 좋은 에이전트인 Claude 3.5 Sonnet (New) with open-source scaffolding은 평균 복제 점수 21.0%를 달성했습니다.

AI 에이전트를 인간 기준과 비교하기 위해 OpenAI는 상위 ML 박사들을 모집해 벤치마크의 일부를 수행하도록 했습니다. 결과는 현재 최첨단 모델이 AI 연구 복제에서 인간 기준을 아직 능가하지 못한다는 것을 보여줍니다.

Availability and Research Goals

OpenAI는 AI 에이전트의 AI 엔지니어링 역량에 대한 추가 연구를 촉진하기 위해 PaperBench 코드를 오픈소스화했으며, 해당 코드베이스는 준비 저장소(preparedness repository)를 통해 GitHub에 공개되었습니다.

Sources