Hugging Face Gaia2 與 Meta Agents Research Environments(ARE)發布

Hugging Face Gaia2 與 Meta Agents Research Environments(ARE)發布

Hugging Face 已發布 Gaia2——一個讀寫型代理基準測試,以及 Meta Agents Research Environments(ARE)框架,用於在複雜的真實世界模擬環境中評估與除錯 AI 代理。

Hugging Face Gaia2 與 Meta Agents Research Environments(ARE)發布

Hugging Face 推出了 Gaia2 與 Meta Agents Research Environments(ARE)框架,以便在複雜、真實世界的模擬環境中研究 AI 代理。過去的基準測試多聚焦於唯讀檢索,而 Gaia2 則引入互動式的讀寫任務,測試代理處理模糊性、噪聲與時間推理的能力。

Gaia2:讀寫型代理基準測試

Gaia2 是 2023 年 GAIA 基準的後繼者。它將焦點從簡單資訊檢索轉向互動行為與複雜度管理。與前作不同,Gaia2 評估代理在面對模糊或時間敏感的查詢時遵循指令的能力,並在包含受控失敗的噪聲環境中運作。

主要任務群組

Gaia2 使用 1,000 個由人類創建的情境,分為七大核心能力:

  • 執行:多步驟指令遵循與工具使用(例如,更新聯絡人)。
  • 搜尋:從多個來源收集資訊(例如,從 WhatsApp 提取資料)。
  • 模糊處理:解決衝突的請求(例如,排程衝突)。
  • 適應性:回應模擬內的變化(例如,根據新資訊更新電子郵件)。
  • 時間/時間推理:執行時間敏感的動作(例如,延遲後叫計程車)。
  • 代理間協作:在未直接存取 API 的情況下,使代理之間能夠溝通。
  • 噪聲容忍:即使 API 發生失敗或環境不穩定,仍能保持韌性。

評估環境與基礎設施

Gaia2 在 Meta Agents Research Environments(ARE)中執行,該環境提供模擬日常人類活動的智慧手機模型。此環境包含模擬的應用程式,如 Email、行事曆、聯絡人、購物與檔案系統,皆可透過工具呼叫存取。

為了便利除錯與分析,ARE 會將所有代理互動記錄為結構化追蹤。這些追蹤包含工具呼叫、API 回應、模型思考與時間指標(例如回應延遲),可匯出為 JSON。

效能結果與模型分析

截至 2025 年 9 月,GPT-5(具高推理能力)是整體得分最高的模型,而 Kimi K2 則是表現最佳的開源模型。

能力差距

評估結果顯示模型在不同任務類型上的表現存在顯著差異:

  • 已解決的能力:簡單的工具呼叫、指令遵循(execution)以及一般的 search 被頂尖模型視為接近解決。
  • 具挑戰性的能力:模糊處理、適應性與噪聲容忍對所有測試模型仍然困難。
  • 關鍵弱點:時間推理(time)目前是最難的分支,因為模型在正確處理時間敏感動作上掙扎。

成本效能分析

除了原始準確度外,Hugging Face 也強調效率的重要性。評估會將分數相對於成本正規化,成本以平均 LLM 呼叫次數與輸出 token 數量衡量,以建立成本效能的 Pareto 前緣。

Meta Agents Research Environments(ARE)框架

ARE 被設計為開放框架(MIT 授權),旨在超越靜態基準,讓研究人員透過互動研究代理。

客製化與使用案例

研究人員可透過 Model Context Protocol(MCP)或直接連接自有工具來擴充 ARE,並透過實作具觸發或定時事件的自訂情境,測試代理如何適應不斷演變的環境。

ARE 的主要使用案例包括:

  • 檢測代理的氛圍:在真實或模擬資料上檢測代理。
  • 測試工具編排:使用本機應用程式或 MCP 工具。
  • 產生工具呼叫追蹤:用於微調模型。
  • 在統一框架內重現現有代理基準
  • 透過使用者介面除錯代理間互動
  • 研究模型在噪聲環境與 API 超時下的限制

實作與授權

  • Gaia2 資料集:以 CC BY 4.0 授權釋出。
  • ARE 框架:以 MIT 授權釋出。
  • 安裝方式:可透過 pip install meta-agents-research-environments 安裝此環境。

Sources