OpenAI PaperBench:评估 AI 代理复制 AI 研究的能力
TL;DR
OpenAI 推出了 PaperBench,这是一项评估 AI 代理是否能够自主复制最前沿 AI 研究的基准。这一点很重要,因为它测试了代理的高级 AI 工程能力,包括理解复杂研究论文、从头开发代码库以及成功执行实验的能力。
PaperBench 基准设计
PaperBench 评估 AI 代理复制 20 篇 2024 年 ICML Spotlight 和 Oral 论文的能力。要成功复制一篇论文,代理必须能够理解论文的贡献,开发完整的代码库,并执行实验以复现结果。
为确保客观评估,OpenAI 制定了评分标准,将每个复制任务分解为 8,316 个可单独评分的子任务。这些评分标准与 ICML 论文的原作者共同制定,以确保评分标准的准确性和真实性。
评估框架与基于 LLM 的判定
为了实现可扩展的评估,OpenAI 实现了一个基于 LLM 的评审器,能够根据既定评分标准自动对复制尝试进行评分。为验证该自动评审器的准确性,团队专门创建了一个独立的基准来评估评审器的表现。
性能结果
OpenAI 在 PaperBench 上评估了多个前沿模型。表现最佳的测试代理——使用开源脚手架的 Claude 3.5 Sonnet(New)——实现了 21.0% 的平均复制得分。
在将 AI 代理与人类基准进行比较时,OpenAI 招募了顶尖的机器学习博士来尝试基准的部分任务。结果表明,当前的前沿模型在复制 AI 研究方面仍未超越人类基准。
可用性与研究目标
OpenAI 已开源 PaperBench 代码,以促进对 AI 代理 AI 工程能力的进一步研究,并通过 preparedness 仓库在 GitHub 上提供代码库.