Hugging Face FutureBench:評估 AI 代理在未來事件預測上的表現

TL;DR

Hugging Face 已推出 FutureBench,一個設計用來評估 AI 代理預測未來現實事件能力的基準。透過聚焦尚未發生的結果,FutureBench 消除資料污染,並提供一個客觀、時間戳記的衡量指標,以評估代理綜合資訊與在不確定性下推理的能力。

以預測為基礎的評估理由

傳統的 AI 基準通常測試模型回憶過去知識或解決已解決過的問題的能力。Hugging Face 主張此方法容易受到資料污染的影響,模型可能在訓練期間已見過測試問題,導致出現「排行榜幻覺」,將記憶力誤認為智慧。

預測未來事件能解決這些方法論問題,原因如下:

  • Contamination is impossible by design:模型無法在尚未存在的資料上進行訓練,因而設計上不會產生污染。
  • Inherent Verifiability:一旦事件發生,預測即可客觀驗證,形成清晰且具時間戳記的績效紀錄。
  • Higher-Order Intelligence:在科學、經濟與地緣政治等領域預測結果,需要綜合、推理與概率權衡,而非單純的模式匹配。

FutureBench 方法論

FutureBench 透過兩個主要資料來源,持續產出有意義的預測任務:

1. 新聞產生的問題

一個基於 smolagents 的代理會爬取主要新聞網站,分析首頁文章,以制定具體且有時間限制的預測問題。

  • Technical Stack:DeepSeek-V3(推理/生成)、Firecrawl(內容抽取)以及 Tavily(情境搜尋)。
  • Cadence:該代理通常每次產生五個問題,預測的實現時間範圍為一週。

2. Polymarket 整合

FutureBench 每週從 Polymarket(預測市場平台)攝取約八個問題。為確保品質,團隊會過濾掉過多關於氣溫、股票與加密貨幣市場的問題。

系統性評估的三個層級

FutureBench 讓研究者能在代理流程中隔離特定變數,以了解效能提升的來源:

  • Level 1:框架比較:在保持 LLM 與工具不變的情況下,測試不同的代理框架(例如 LangChain 與 CrewAI)。
  • Level 2:工具效能:比較不同的搜尋實作(例如 Tavily、Google、Bing),或衡量具備工具的模型與無網路存取的基礎模型之價值。
  • Level 3:模型能力:在框架與工具固定的前提下,測試不同的 LLM(例如 DeepSeek-V3 與 GPT-4),以評估純粹的推理能力。

初步結果與模型行為

smolagents 為基線框架,並使用包含 Tavily 搜尋與網頁爬蟲的工具組,Hugging Face 發現代理模型始終優於基礎語言模型。此基準亦揭示領先模型之間的明顯行為模式:

  • Claude 3.7:展現嚴謹的分析結構,使用系統化的贊成/反對框架與量化差距分析。它傾向透過頻繁爬取深入探索網路,導致輸入 token 成本上升。
  • GPT-4.1:主要聚焦於市場共識與現有預測,將其作為未來事件的主要訊號,而非從原始資料中推斷。
  • DeepSeek-V3:展現系統化的方法論,並在初始搜尋受限時明確說明資料的限制。

限制與未來方向

目前發現的主要挑戰是評估成本高昂。像 Claude 這類頻繁爬取網頁的模型,會在多輪迴圈中累積大量輸入 token,顯著提升生成成本。Hugging Face 計畫持續發展 FutureBench,加入新模式,並徵求社群對問題來源與資料分析的回饋。

Sources