Hugging Face FutureBench:评估 AI 代理在未来事件预测中的表现
TL;DR
Hugging Face 推出了 FutureBench,这是一项旨在评估 AI 代理预测未来真实世界事件能力的基准。通过聚焦尚未发生的结果,FutureBench 消除了数据污染,并提供了一个客观、带时间戳的衡量指标,用以评估代理在信息综合和不确定性推理方面的能力。
基于预测的评估理由
传统的 AI 基准通常测试模型回忆过去知识或解决已解决问题的能力。Hugging Face 认为这种方法容易受到数据污染的影响,模型可能在训练期间已经见过测试问题,从而导致一种“排行榜幻觉”,即将记忆当作智能。
预测未来事件可以解决这些方法论问题,因为:
- 设计上不可能出现污染:模型无法在尚不存在的数据上进行训练。
- 固有可验证性:一旦事件发生,预测即可客观验证,形成清晰的、带时间戳的表现记录。
- 更高层次的智能:在科学、经济和地缘政治等领域预测结果需要信息综合、推理以及对概率的权衡,而非单纯的模式匹配。
FutureBench 方法论
FutureBench 使用两类主要数据源生成源源不断的有意义的预测任务:
1. 新闻生成的问题
基于 smolagents 的代理会抓取主要新闻网站并分析首页文章,以制定具体且有时间限制的预测问题。
- 技术栈:DeepSeek-V3(推理/生成)、Firecrawl(内容提取)和 Tavily(上下文搜索)。
- 频率:该代理通常每次会生成五个问题,预测实现的时间范围为一周。
2. Polymarket 集成
FutureBench 每周从预测市场平台 Polymarket 中获取约八个问题。为确保质量,团队会过滤掉过多的温度、股票和加密货币市场相关问题。
系统化评估的三个层级
FutureBench 使研究者能够在代理流水线中隔离特定变量,以了解性能提升的来源:
- 层级 1:框架比较:在保持 LLM 与工具不变的前提下,测试不同的代理框架(例如 LangChain 与 CrewAI)。
- 层级 2:工具性能:比较不同的搜索实现(例如 Tavily、Google、Bing),或衡量有无互联网访问的工具相对于基础模型的价值。
- 层级 3:模型能力:在保持框架和工具不变的情况下,测试不同的 LLM(例如 DeepSeek-V3 与 GPT-4),以衡量纯粹的推理能力。
初步结果与模型行为
使用 smolagents 作为基线框架,并配备 Tavily 搜索和网页抓取工具,Hugging Face 观察到代理模型始终优于基础语言模型。该基准还揭示了领先模型之间的不同行为模式:
- Claude 3.7:展现出严谨的分析结构,使用系统化的利弊框架和量化差距分析。它倾向于通过频繁抓取更深入地探索网页,这会增加输入 token 成本。
- GPT-4.1:主要关注市场共识和已有预测作为未来事件的主要信号,而非从原始数据进行外推。
- DeepSeek-V3:展示出系统化的方法论,并在初始搜索遇到限制时明确说明数据局限性。
局限性与未来方向
主要挑战在于评估成本高昂。像 Claude 这类频繁抓取网页的模型会在多轮循环中累计大量输入 token,显著提升生成成本。Hugging Face 计划通过加入新模式并征求社区对问题来源和数据分析的反馈,持续完善 FutureBench。