OpenAI BrowseComp 基准发布
OpenAI 已发布 BrowseComp,这是一项新的开源基准,包含 1,266 道具有挑战性的问题,旨在评估 AI 代理在互联网上定位难以发现、交织信息的能力。该基准针对现有工具(如 SimpleQA)已趋于饱和的情况,这些工具仅衡量基本的孤立事实检索,而 BrowseComp 则聚焦于需要坚持、策略性推理和深入浏览的任务。
BrowseComp 设计与方法论
BrowseComp 侧重于答案简短、唯一且无可争议的问题,这类答案易于验证却难以找到。这种“验证不对称性”使得评分既简单可靠,同时保持了高难度。
为确保基准保持挑战性,OpenAI 在创建过程中采用了三项具体的验证检查:
- 模型失效:训练者验证 GPT-4o(包括有浏览和无浏览两种)、o1 以及早期版本的 Deep Research 模型均无法解决该问题。
- 搜索引擎抗性:训练者确认在进行五次简单搜索后,答案并未出现在搜索引擎结果的前几页中。
- 人类难度:任务设计使得人类在十分钟内难以解决。若第二位训练者的解答成功率超过 40%,该任务将被修改。
问题通常采用“倒置”方法创建:训练者先确定一个已知事实(种子),然后围绕具有大搜索空间的特征构造问题。例如,可能会要求根据作者的本科院校和会议年份寻找特定的科学论文,这要求代理审阅大量论文和作者背景以找到匹配。
人类表现与数据集难度
人类训练者在未使用 AI 助手的情况下尝试解答 BrowseComp 问题。结果凸显了数据集的极端难度:
- 成功率:训练者仅解答了 29.2% 的问题。
- 准确率:在已解答的问题中,训练者的答案与参考答案匹配的比例为 86.4%。
- 时间投入:许多可解的问题需要两到三小时的研究。对于不可解的问题,大多数训练者在约两小时的搜索后放弃。
模型表现比较
OpenAI 对多种模型在 BrowseComp 上进行了评估,表明仅具备基础浏览能力不足以完成这些任务。结果显示标准大语言模型与专用代理模型之间存在显著差距:
| 模型 | 准确率(%) |
|---|---|
| GPT-4o | 0.6 |
| GPT-4o w/ browsing | 1.9 |
| GPT-4.5 | 0.9 |
| OpenAI o1 | 9.9 |
| Deep Research* | 51.5 |
*注:Deep Research 模型是在专门为 BrowseComp 任务设计的数据上进行训练的。
- 浏览 vs. 推理:为 GPT-4o 开启浏览功能仅将准确率从 0.6% 提升至 1.9%,表明仅使用工具不足以解决问题。
- 内部知识:尽管 OpenAI o1 不具备浏览能力,但其 9.9% 的更高准确率表明某些答案可以通过对内部知识的推理获得。
- 代理能力:Deep Research 模型的 51.5% 准确率展示了自主搜索、整合多源信息以及调整搜索策略的有效性。
扩展与优化策略
测试时计算规模化
BrowseComp 的性能随测试时计算资源的增加而平滑提升。由于这些任务需要迭代式浏览和信息整合,额外的推理计算直接转化为更好的结果。
聚合策略
OpenAI 测试了三种方法,将每个问题的 64 个抽样输出进行组合,以提升单次尝试的准确率:
- 多数投票:选择出现次数最多的答案。
- 加权投票:根据模型生成的置信分数对投票进行加权。
- 最佳 N 选:选择置信分数最高的输出。
最佳 N 选始终实现最高准确率,较单次尝试提升了 15% 至 25%。这表明 Deep Research 模型常能识别自身答案的正确性。
任务难度分析
对 Deep Research 与 OpenAI o1 的通过率进行分析后发现任务难度差距显著。Deep Research 完全解决了 16% 的任务(通过率 100%),但在 14% 的任务上完全失败(通过率 0%)。
对于 Deep Research 失败的那部分问题,OpenAI 发现若向模型提供真实答案,模型即可找到支持证据。这证明这些问题并非不可解,而是需要策略性的坚持和灵活的搜索重构,模型无法自行实现。