Hugging Face FutureBench: 미래 이벤트 예측에 대한 AI 에이전트 평가

TL;DR

Hugging Face는 FutureBench를 도입했습니다. 이 벤치마크는 AI 에이전트가 미래 실제 사건을 예측하는 능력을 평가하도록 설계되었습니다. 아직 발생하지 않은 결과에 초점을 맞춤으로써 FutureBench는 데이터 오염을 제거하고, 에이전트가 정보를 종합하고 불확실성 하에서 추론하는 능력을 객관적이고 시간 스탬프가 찍힌 방식으로 측정합니다.

예측 기반 평가의 근거

전통적인 AI 벤치마크는 일반적으로 모델이 과거 지식을 회상하거나 이전에 해결된 문제를 푸는 능력을 테스트합니다. Hugging Face는 이러한 접근 방식이 데이터 오염에 취약하다고 주장합니다. 모델이 학습 중에 테스트 질문을 본 적이 있을 수 있어, 암기를 지능으로 착각하게 만드는 "리더보드 착시"가 발생합니다.

예측 기반 미래 사건은 다음과 같은 이유로 이러한 방법론적 문제를 해결합니다:

  • Contamination is impossible by design: 모델은 아직 존재하지 않는 데이터에 대해 학습할 수 없으므로 오염이 설계상 불가능합니다.
  • Inherent Verifiability: 사건이 발생하면 예측을 객관적으로 검증할 수 있어, 성과에 대한 명확하고 시간 스탬프가 찍힌 기록을 생성합니다.
  • Higher-Order Intelligence: 과학, 경제, 지정학 분야의 결과를 예측하려면 단순 패턴 매칭이 아니라 종합, 추론, 확률 가중이 필요합니다.

FutureBench 방법론

FutureBench는 두 가지 주요 데이터 소스를 사용하여 지속적인 의미 있는 예측 과제를 생성합니다:

1. 뉴스 기반 질문

smolagents 기반 에이전트가 주요 뉴스 웹사이트를 스크랩하고 첫 페이지 기사를 분석하여 구체적이고 시간 제한이 있는 예측 질문을 만듭니다.

  • Technical Stack: DeepSeek-V3 (추론/생성), Firecrawl (콘텐츠 추출), Tavily (컨텍스트 검색).
  • Cadence: 에이전트는 일반적으로 세션당 다섯 개의 질문을 생성하며, 실현까지 일주일의 시간 범위를 가집니다.

2. Polymarket 통합

FutureBench는 예측 시장 플랫폼인 Polymarket에서 주당 약 여덟 개의 질문을 받아들입니다. 품질을 보장하기 위해 팀은 온도, 주식, 암호화폐 시장에 관한 과도한 질문을 필터링합니다.

체계적 평가의 세 단계

FutureBench는 연구자들이 에이전트 파이프라인의 특정 변수를 분리하여 성능 향상이 발생하는 지점을 이해할 수 있게 합니다:

  • Level 1: Framework Comparison: LLM과 도구를 동일하게 유지하면서 서로 다른 에이전트 프레임워크(예: LangChain vs. CrewAI)를 테스트합니다.
  • Level 2: Tool Performance: 서로 다른 검색 구현(예: Tavily, Google, Bing)을 비교하거나, 인터넷 접근이 없는 기본 모델 대비 도구의 가치를 측정합니다.
  • Level 3: Model Capabilities: 프레임워크와 도구를 고정한 상태에서 서로 다른 LLM(예: DeepSeek-V3 vs. GPT-4)을 테스트하여 순수 추론 능력을 측정합니다.

초기 결과 및 모델 행동

smolagents를 기본 프레임워크로, Tavily 검색과 웹 스크래퍼로 구성된 툴킷을 사용하여, Hugging Face는 에이전트 모델이 기본 언어 모델보다 일관되게 우수함을 관찰했습니다. 또한 벤치마크는 주요 모델들 사이에서 뚜렷한 행동 패턴을 밝혀냈습니다:

  • Claude 3.7: 엄격한 분석 구조를 보여주며, 체계적인 장단점 프레임워크와 정량적 격차 분석을 활용합니다. 빈번한 스크래핑을 통해 웹을 더 깊이 탐색하는 경향이 있어 입력 토큰 비용이 증가합니다.
  • GPT-4.1: 원시 데이터에서 추론하기보다 시장 합의와 기존 예측을 미래 사건에 대한 주요 신호로 크게 의존합니다.
  • DeepSeek-V3: 체계적인 방법론을 보여주며, 초기 검색 접근이 제약에 부딪혔을 때 데이터 제한을 명시적으로 인정합니다.

제한 사항 및 향후 방향

주요 과제로 확인된 것은 평가 비용이 높다는 점입니다. Claude와 같이 웹 페이지를 자주 스크래핑하는 모델은 다중 턴 루프에서 많은 입력 토큰을 축적하여 생성 비용을 크게 증가시킵니다. Hugging Face는 새로운 패턴을 도입하고 질문 출처 및 데이터 분석에 대한 커뮤니티 피드백을 받아 FutureBench를 지속적으로 발전시킬 계획입니다.

Sources