OpenAI BrowseComp ベンチマークリリース

OpenAIはBrowseCompをリリースしました。これは、インターネット上で見つけにくく絡み合った情報を探し出すAIエージェントの能力を評価するために設計された、1,266の難易度の高い問題からなる新しいオープンソースベンチマークです。このベンチマークは、基本的な単一事実取得を測定するSimpleQAのような既存ツールが飽和状態にあることに対処し、粘り強さ、戦略的推論、深い閲覧を必要とするタスクに焦点を当てています。

BrowseComp の設計と方法論

BrowseCompは、短く、単一で、争いの余地のない回答を持ち、検証は容易だが見つけるのは難しい質問に焦点を当てています。この「検証の非対称性」により、シンプルで信頼性の高い採点が可能になりつつ、高い難易度を維持できます。

To ensure the benchmark remains challenging, OpenAI employed three specific verification checks during the creation process:

  1. モデル失敗: トレーナーは、GPT-4o(閲覧あり・なし)、o1、およびDeep Researchモデルの初期バージョンが問題を解決できないことを確認しました。
  2. 検索エンジン抵抗性: トレーナーは、5回の簡単な検索の後、検索エンジン結果の最初のページに回答が存在しないことを確認しました。
  3. 人間の難易度: タスクは、人間が10分以内に解くのが困難になるように設計されました。2人目のトレーナーが40%以上の確率で解いたタスクは修正されました。

質問はしばしば「逆転」アプローチで作成されました。トレーナーは既知の事実(シード)から出発し、広い検索空間を持つ特性に基づいて質問を作成しました。例えば、著者の学部出身校と会議の開催年に基づいて特定の科学論文を求める質問では、エージェントは多数の論文と著者の背景を調査して一致するものを見つける必要があります。

人間のパフォーマンスとデータセットの難易度

Human trainers, without the aid of AI assistants, attempted to solve the BrowseComp questions. The results highlight the extreme difficulty of the dataset:

  • 成功率: トレーナーは問題のうちわずか29.2%しか解決できませんでした。
  • 正確性: 解決された問題のうち、トレーナーの回答が参照回答と一致したのは86.4%でした。
  • 時間投資: 解ける問題の多くは2〜3時間の調査が必要でした。解けない問題に対しては、ほとんどのトレーナーが約2時間の検索で諦めました。

モデルパフォーマンス比較

OpenAI evaluated several models on BrowseComp, demonstrating that basic browsing capabilities are insufficient for these tasks. The results show a significant gap between standard LLMs and specialized agent models:

モデル 正確率 (%)
GPT-4o 0.6
GPT-4o w/ browsing 1.9
GPT-4.5 0.9
OpenAI o1 9.9
Deep Research* 51.5

*注: Deep ResearchモデルはBrowseCompタスク用に特別に設計されたデータで訓練されました。

Key insights from these results include:

  • 閲覧 vs. 推論: GPT-4oに閲覧機能を付与しても正確率は0.6%から1.9%へわずかに向上しただけで、ツールの使用だけでは不十分であることを示しています。
  • 内部知識: OpenAI o1は閲覧機能がないにもかかわらず正確率が9.9%と高く、内部知識の推論で回答が得られることを示唆しています。
  • エージェント能力: Deep Researchモデルの正確率51.5%は、自治的検索、複数ソースからの情報統合、検索戦略の適応が有効であることを示しています。

スケーリングと最適化戦略

テスト時コンピュートのスケーリング

BrowseCompのパフォーマンスは、使用されるテスト時コンピュート量に比例してスムーズにスケールします。これらのタスクは反復的な閲覧と情報の統合を必要とするため、推論時のコンピュートを増やすことで直接的に結果が向上します。

集約戦略

OpenAI tested three methods for combining 64 sampled outputs per question to improve accuracy beyond a single attempt:

  • 多数決投票: 最も頻出する回答を選択する。
  • 重み付き投票: モデルが生成した信頼度スコアで投票に重み付けを行う。
  • Best-of-N: 最も高い信頼度スコアを持つ出力を選択する。

Best-of-Nは常に最高の正確率を達成し、単一試行に比べてパフォーマンスを15%から25%向上させました。これはDeep Researchモデルが自身の回答が正しいかどうかをしばしば識別できることを示唆しています。

タスク難易度の分析

Deep ResearchとOpenAI o1の合格率を分析した結果、タスク難易度に大きな差があることが明らかになりました。Deep Researchはタスクの16%を完全に解決(合格率100%)しましたが、14%のタスクでは全く解決できませんでした(合格率0%)。

For the subset of questions where Deep Research failed, OpenAI found that providing the model with the ground-truth answer allowed it to locate supporting evidence. This confirms that the questions were not unsolvable, but rather required strategic perseverance and flexible search reformulation that the model could not achieve autonomously.

Deep Researchが失敗した質問のサブセットについて、OpenAIはモデルに正解を与えることで支援証拠を見つけられることを確認しました。これは、質問が解けないわけではなく、戦略的な粘り強さと柔軟な検索再構成が必要であり、モデルが自律的に達成できなかったことを示しています。

Sources