OpenAI PaperBench:評估 AI 代理人複製 AI 研究的能力
TL;DR
OpenAI 推出了 PaperBench,一項評估 AI 代理人是否能自主複製最先進 AI 研究的基準。這很重要,因為它測試了代理人在高階 AI 工程方面的能力,包括理解複雜研究論文、從頭開發程式碼庫以及成功執行實驗的能力。
PaperBench 基準設計
PaperBench 評估 AI 代理人複製 20 篇 2024 年 ICML Spotlight 與 Oral 論文的能力。要成功複製一篇論文,代理人必須能夠理解論文的貢獻、開發完整的程式碼庫,並執行實驗以重現結果。
為確保客觀評估,OpenAI 制定了評分規範,將每個複製任務分解為 8,316 個可單獨評分的子任務。這些規範與 ICML 論文的原作者共同開發,以確保評分標準的準確性與真實性。
評估框架與基於 LLM 的判斷
為了實現可擴展的評估,OpenAI 實作了一個基於 LLM 的評審,能自動根據既定評分規範對複製嘗試進行評分。為驗證此自動評審的準確性,團隊另建了一個專門用於評估評審表現的基準。
效能結果
OpenAI 在 PaperBench 上評估了多個前沿模型。表現最佳的測試代理人——使用開源腳手架的 Claude 3.5 Sonnet(新)——取得了 21.0% 的平均複製分數。
在將 AI 代理人與人類基準比較時,OpenAI 招募了頂尖的機器學習博士生來嘗試基準的部分子集。結果顯示,目前的前沿模型仍未能在複製 AI 研究方面超越人類基準。
可用性與研究目標
OpenAI 已開源 PaperBench 程式碼,以促進對 AI 代理人 AI 工程能力的進一步研究,並透過 preparedness 倉庫在 GitHub 上提供程式碼庫。