OpenAI PaperBench: AIエージェントのAI研究再現能力の評価

TL;DR

OpenAIはPaperBenchというベンチマークを導入し、AIエージェントが最先端のAI研究を自律的に再現できるかを評価します。これは、エージェントが複雑な研究論文を理解し、ゼロからコードベースを構築し、実験を成功裏に実行できるかという高度なAIエンジニアリング能力をテストするため、重要です。

PaperBench Benchmark Design

PaperBenchは、AIエージェントがICML 2024のSpotlightおよびOral論文20本を再現する能力を評価します。論文を再現するためには、エージェントは論文の貢献を理解し、完全なコードベースを開発し、結果を再現する実験を実行できなければなりません。

客観的な評価を確保するため、OpenAIは各再現タスクを8,316の個別に採点可能なサブタスクに分解したルーブリックを作成しました。これらのルーブリックは、ICML論文の原著者と共同で開発され、採点基準の正確性と現実性が保証されています。

Evaluation Framework and LLM-based Judging

スケーラブルな評価を可能にするため、OpenAIはLLMベースのジャッジを実装し、確立されたルーブリックに基づいて再現試行を自動的に採点します。この自動ジャッジの精度を検証するため、チームはジャッジの性能を評価する専用ベンチマークを別途作成しました。

Performance Results

OpenAIは複数の最先端モデルをPaperBenchで評価しました。テストされた中で最も高い性能を示したエージェントは、オープンソースのスキャフォールディングを使用したClaude 3.5 Sonnet (New)で、平均再現スコアは21.0%でした。

AIエージェントと人間ベースラインを比較するため、OpenAIはトップクラスのML PhDを募集し、ベンチマークの一部を実施させました。その結果、現行の最先端モデルはまだ人間ベースラインを上回っていないことが示されました。

Availability and Research Goals

OpenAIはPaperBenchのコードをオープンソース化し、AIエージェントのAIエンジニアリング能力に関するさらなる研究を促進しています。コードベースはGitHubのpreparenessリポジトリで入手可能です。

Sources