OpenAI BrowseComp 基準發布

OpenAI 已發布 BrowseComp,一個新的開源基準,包含 1,266 個具挑戰性的問題,旨在評估 AI 代理在互聯網上尋找難以發現、錯綜複雜資訊的能力。此基準針對現有工具(如 SimpleQA)已飽和的情況,這些工具僅測量基本的孤立事實檢索,透過聚焦於需要持續性、策略性推理與深入瀏覽的任務來解決此問題。

BrowseComp 設計與方法論

BrowseComp 專注於答案簡短、唯一且無可爭議的問題,這類答案易於驗證卻難以找到。這種「驗證不對稱」使得評分簡單且可靠,同時保持高難度。

為確保基準保持挑戰性,OpenAI 在創建過程中採用了三項特定的驗證檢查:

  1. 模型失敗:訓練師驗證 GPT-4o(有無瀏覽功能皆如此)、o1 以及早期版本的 Deep Research 模型均無法解決此問題。
  2. 搜尋引擎抗性:訓練師確認在進行五次簡單搜尋後,答案並未出現在搜尋引擎結果的前幾頁。
  3. 人類難度:任務設計使得人類在十分鐘內難以解決。若第二位訓練師解決率超過 40%,則會對任務進行修正。

問題通常採用「反向」方式產生:訓練師先從已知事實(種子)出發,根據具有龐大搜尋空間的特徵設計問題。例如,問題可能要求根據作者的本科就讀學校與會議年份,找出特定的科學論文,這需要代理檢視大量論文與作者背景以找到匹配。

人類表現與資料集難度

人類訓練師在未使用 AI 助手的情況下嘗試解決 BrowseComp 問題。結果凸顯了資料集的極高難度:

  • 成功率:訓練師僅解決了 29.2% 的問題。
  • 正確率:在已解決的問題中,訓練師的答案與參考答案相符的比例為 86.4%。
  • 時間投入:許多可解決的問題需要兩至三小時的研究。對於無法解決的問題,大多數訓練師在約兩小時的搜尋後放棄。

模型表現比較

OpenAI 在 BrowseComp 上評估了多個模型,顯示僅具備基本瀏覽功能的模型不足以應對這些任務。結果顯示標準大型語言模型與專門的代理模型之間存在顯著差距:

模型 正確率 (%)
GPT-4o 0.6
GPT-4o w/ browsing 1.9
GPT-4.5 0.9
OpenAI o1 9.9
Deep Research* 51.5

*註:Deep Research 模型是使用專門為 BrowseComp 任務設計的資料進行訓練的。

從這些結果中可得的關鍵見解包括:

  • 瀏覽 vs. 推理:為 GPT-4o 開啟瀏覽功能僅略微提升了正確率(0.6% → 1.9%),顯示僅使用工具不足以解決問題。
  • 內部知識:OpenAI o1 雖無瀏覽功能,但正確率較高(9.9%),表明某些答案可透過內部知識推理得出。
  • 代理能力:Deep Research 模型的 51.5% 正確率顯示自主搜尋、整合多來源資訊以及調整搜尋策略的效能。

擴展與最佳化策略

測試時運算資源擴展

BrowseComp 的表現會隨測試時使用的運算資源量平滑提升。由於這些任務需要迭代式瀏覽與資訊整合,額外的推論時運算資源直接轉化為更佳的結果。

聚合策略

OpenAI 測試了三種方法,將每題 64 個抽樣輸出結合,以提升單次嘗試之外的正確率:

  • 多數投票:選取最常見的答案。
  • 加權投票:根據模型產生的信心分數加權投票。
  • 最佳 N:選取信心分數最高的輸出。

最佳 N 方法始終取得最高的正確率,較單次嘗試提升了 15% 至 25%。這暗示 Deep Research 模型常能辨識自身答案的正確性。

任務難度分析

對 Deep Research 與 OpenAI o1 通過率的分析顯示任務難度差距甚大。Deep Research 完全解決了 16% 的任務(通過率 100%),但在 14% 的任務上完全失敗(通過率 0%)。

對於 Deep Research 失敗的問題子集,OpenAI 發現若提供模型正確答案,模型即可找到支持證據。這證實這些問題並非無解,而是需要策略性的堅持與彈性的搜尋重構,模型無法自行完成。

Sources