facebookresearch/meta-agents-research-environments

Meta Agents Research Environments is a comprehensive platform designed to evaluate AI agents in dynamic, realistic scenarios. Unlike static benchmarks, this platform introduces evolving environments where agents must adapt their strategies as new information becomes available, mirroring real-world challenges.

What it solves

AI agent 評估通常依賴於無法反映現實世界不可預測性的靜態基準測試。本專案提供了一個平台,用於在動態環境中測試代理,這些環境中的條件會不斷變化並出現新資訊,要求代理即時調整其策略。

How it works

ARE 透過建立由「Apps」(例如電子郵件或日曆)和「Events」(動態變化)組成的模擬環境,進而形成複雜的「Scenarios」。代理使用 ReAct (Reasoning + Acting) 框架與這些環境進行互動。該平台包含 Gaia2 基準測試,其特色是在 10 個宇宙中提供 800 個場景,用以測試多步驟推理和適應能力。

Who it’s for

需要嚴謹且現實的方式來評估其代理處理長週期任務和演進資訊的能力,正在開發自主代理的 AI 研究人員和開發人員。

Highlights

  • Dynamic Scenarios: 超越靜態問答,轉向隨時間演進的環境。
  • Gaia2 Benchmark: 一套完整的 800 個場景,專為複雜的多步驟推理(10+ 步驟)而設計。
  • Omnilingual-Gaia2: 一種支援 10 種不同語言的多語言擴展。
  • Interactive GUI: 一個用於即時監控代理並將任務執行過程視覺化為有向無環圖 (DAGs) 的網頁介面。
  • Broad Model Support: 與 LiteLLM 的整合讓使用者能輕鬆在各種基於 API 的和本地 LLM 提供者之間進行切換。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • 專案