Hugging Face Gaia2 と Meta Agents Research Environments (ARE) リリース

Hugging Face は、複雑で実世界に近いシミュレーション環境における AI エージェントの研究を可能にするために、Gaia2 と Meta Agents Research Environments (ARE) フレームワークを導入しました。従来のベンチマークが読み取り専用の検索に焦点を当てていたのに対し、Gaia2 はインタラクティブな読み書きタスクを導入し、エージェントの曖昧さ、ノイズ、時間的推論への対応能力をテストします。

Gaia2: 読み書きエージェントベンチマーク

Gaia2 は 2023 年の GAIA ベンチマークの後継です。シンプルな情報検索からインタラクティブな行動と複雑性管理へと焦点をシフトさせました。前作とは異なり、Gaia2 は曖昧または時間に敏感なクエリに対する指示遵守能力や、制御された失敗を伴うノイズの多い環境での動作を評価します。

主なタスクグループ

Gaia2 は、7 つの主要な能力に分類された 1,000 件の人間作成シナリオを活用します。

  • 実行: 複数ステップの指示に従いツールを使用する(例: 連絡先の更新)。
  • 検索: 複数の情報源からデータを収集する(例: WhatsApp からのデータ抽出)。
  • 曖昧さ処理: 矛盾するリクエストを解決する(例: スケジュールの競合)。
  • 適応性: シミュレーション内の変化に対応する(例: 新情報に基づくメールの更新)。
  • 時間/時間的推論: 時間に敏感なアクションを実行する(例: 遅延後にタクシーを手配)。
  • エージェント間協調: 直接 API にアクセスせずエージェント同士の通信を可能にする。
  • ノイズ耐性: API の失敗や環境の不安定さがあっても堅牢性を維持する。

評価環境とインフラストラクチャ

Gaia2 は Meta Agents Research Environments (ARE) 内で実行され、日常の人間活動をシミュレートするスマートフォンのモックアップを提供します。この環境には、メール、カレンダー、連絡先、ショッピング、ファイルシステムなどのシミュレートされたアプリケーションが含まれ、すべてツール呼び出しでアクセス可能です。

デバッグと分析を容易にするため、ARE はすべてのエージェントのやり取りを構造化トレースとして記録します。これらのトレースにはツール呼び出し、API 応答、モデルの考え、タイミング指標(例: 応答遅延)などが含まれ、JSON としてエクスポート可能です。

パフォーマンス結果とモデル分析

2025 年 9 月時点で、GPT-5(高度な推論機能搭載)は全体で最も高得点のモデルであり、Kimi K2 が最高性能のオープンソースモデルです。

能力ギャップ

評価結果は、タスクタイプごとにモデルの性能に大きな差があることを示しています。

  • 解決済み能力: シンプルなツール呼び出し、指示遵守(execution)および一般的な search は、上位モデルではほぼ解決済みと見なされています。
  • 課題となる能力: 曖昧さ、適応性、ノイズ耐性は、テストされたすべてのモデルにとって依然として難しいです。
  • 重大な弱点: 時間的推論(time)は現在最も難しい分野であり、モデルは時間に敏感なアクションを正しく処理するのに苦労しています。

コストパフォーマンス分析

単なる正確性を超えて、Hugging Face は効率性の重要性を強調しています。評価は、LLM 呼び出し回数と出力トークン数の平均で測定されたコストに対してスコアを正規化し、コストパフォーマンスのパレートフロンティアを構築します。

Meta Agents Research Environments (ARE) フレームワーク

ARE は、静的ベンチマークを超えてインタラクションを通じてエージェントを研究できるように設計されたオープンフレームワーク(MIT ライセンス)です。

カスタマイズとユースケース

研究者は、Model Context Protocol (MCP) を介して、または直接自分のツールを接続することで ARE を拡張でき、トリガーやタイムイベントを持つカスタムシナリオを実装して、エージェントが変化する環境にどのように適応するかをテストできます。

ARE の主なユースケースは以下です:

  • バイブチェックエージェント: 実データまたはシミュレートデータ上でのエージェント。
  • ツールオーケストレーションのテスト: ローカルアプリや MCP ツールを使用して。
  • ツール呼び出しトレースの生成: モデルのファインチューニング用に。
  • 既存エージェントベンチマークの再現: 統一フレームワーク内で。
  • エージェント間インタラクションのデバッグ: ユーザーインターフェースを通じて。
  • モデルの制限の研究: API タイムアウトがあるノイズ環境で。

実装とライセンス

  • Gaia2 データセット: CC BY 4.0 ライセンスでリリース。
  • ARE フレームワーク: MIT ライセンスでリリース。
  • インストール: 環境は pip install meta-agents-research-environments でインストール可能です。

Sources