Accio-org/CommerceAgentBench

CommerceAgentBench: Benchmarking Long-Horizon Agents in High-Fidelity, Stateful, and Reproducible Replicas of Real Online Services

Commerce Agent Bench – 何であるか

Commerce Agent Bench は、アリババ国際チームの Accio チームが開発した、自律型 AI エージェント の評価を目的としたベンチマークスイートです。実世界の複数ステップにわたる e コマースワークフローを実行できるかどうかを検証します。一般的な質問応答や単一ターンテストとは異なり、このベンチマークは各タスクを隔離された Docker コンテナ内で実行し、実世界のサービス(例:アリババ製品公開、Freightos物流、Shopify管理画面)のモック版をホストします。エージェントはブラウザ、コマンドラインツール、API、スプレッドシート、ドキュメントと人間が行うのと同じように対話し、結果は決定論的または LLM による検証器で検証されます。


主な特徴(README に記載)

特徴 詳細
タスクセット CLI、ブラウザ、ファイル、API/MCP 操作をカバーする 107 のタスク。3 つの能力スライスに分類:65 個のテキスト専用、20 個のブラウザ+テキスト対応、22 個のビジュアル必須タスク。
状態保持評価 各タスクはローカルのモックサービスを備えた新規コンテナで実行され、SaaS、e コマース、メッセージング、ドキュメントシステムをエミュレートするため、エージェントは実際に状態を変更(例:製品リストの作成)します。
検証可能な出力 実行後、フレームワークは完全な構成、実行軌跡、検証結果、ログ、コンテナメタデータを保存し、再現性の検証が可能になります。
ハーネス ベンチマークは、ピンされた Docker イメージ(acciolyk/accio_bench@sha256:…)にパッケージ化された OpenClaw ランナー(バージョン 2026.5.22)を使用します。
検証 各タスクには独自の検証器があります。一部は純粋な決定論的チェック、他は LLM 判定者(デフォルト:Gemini 3.1-pro-preview)を使用。タスクが合格するには すべて の必須チェックが成功しなければなりません。
報告されるメトリクス 合格率(合格タスク数 / 107)、平均ステップ数(ツールコール回数)、平均時間(ウォールクロック)、平均トークン数(モデル使用量)。
リファレンス結果 README には、3 つのハーネス(Pi、OpenClaw、Accio)のスナップショットリーダーボードが含まれており、10 種類以上のモデルファミリーのパフォーマンスを示しています(例:Claude Opus 5 が約 61% の合格率でトップ)。
拡張性 ユーザーは新しいモックサービスを貢献できます。貢献されたサービスは最初 mock_services/contrib/ に配置され、後に公式タスクセットに統合されます。
クイックスタート Python 3.11+ の仮想環境でインストールし、ピンされた Docker イメージを取得してから、commerce-agent-bench CLI で単一タスクまたはフルスイートを実行します。
再現性契約 リポジトリはタスクセット、タスク定義、ハーネスバージョン、ランタイムイメージ(v1.3.1)をピンしています。ユーザーは、プロバイダー、モデル、判定者、その他のランタイム詳細を報告するよう求められ、結果の比較を可能にします。

誰が使うべきか?

  • Web UI、CLI、API で動作する LLM ベースのエージェントを開発する研究ラボ。
  • e コマース指向のワークフローにおいて、モデルファミリー間を客観的に比較できる状態保持ベンチマークを求める LLM プロバイダー。
  • 実際の e コマースプラットフォームに展開する前に、社内またはプレリリースエージェントを評価する製品チーム。

使い始め方(README の手順の要約)

  1. 環境のセットアップ – Docker(Linux/AMD64)と Python 3.11+。仮想環境を作成し、パッケージをインストール(pip install -e .)。
  2. ベンチマークランタイムの取得docker pull acciolyk/accio_bench@sha256:<digest>(digest はリポジトリでピンされています)。
  3. API キーの提供 – テストしたいモデルのキー(例:GEMINI_API_KEY)と LLM 判定者のキー(Gemini-3.1-pro-preview 用は GEMINI_API_KEY、OpenAI/Anthropic などは適切なキー)をエクスポート。
  4. タスクの実行 – 例:Gemini 3.5-flash で Amazon margin floor audit タスクを実行。
  5. フルスイートの実行commerce-agent-bench run --config configs/openclaw_native_google_direct.yaml を使用(オプションで --limit 1 を指定してスモークテストを実行)。
  6. 結果の確認 – 実行後、runs/<run_id>/ ディレクトリに summary.jsonreport.html、各タスクのマニフェスト(ログ、スクリーンショット、出力アーティファクト付き)が含まれます。

ライセンスとコミュニティ

このプロジェクトはオープンソースです(README には特定のライセンスは記載されていませんが、リポジトリには標準的な貢献およびセキュリティポリシーが含まれています)。貢献は歓迎され、特にベンチマークのカバレッジを拡張する新しいモックサービスの貢献を歓迎します。チームは要望に応じてプライベートモデルの評価を提供し、協働も受け入れています。


結論:Commerce Agent Bench は、再現性と検証可能性を備えた本格的なプロダクションレベルのベンチマークであり、LLM ベースのエージェントがエンドツーエンドの e コマースタスクを実行できるかどうかを検証するためのものです。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト