Accio-org/CommerceAgentBench

CommerceAgentBench: Benchmarking Long-Horizon Agents in High-Fidelity, Stateful, and Reproducible Replicas of Real Online Services

Commerce Agent Bench – 是什麼

Commerce Agent Bench 是由阿里巴巴國際團隊的 Accio 團隊所開發的基準測試套件,用於評估需要執行真實世界、多步驟電商工作流程的 自主 AI 代理。與典型的問答或單回合測試不同,此基準測試在隔離的 Docker 容器中執行每個任務,容器內託管真實世界服務的模擬版本(例如:阿里巴巴產品發佈、Freightos 物流、Shopify 管理後台)。代理必須像人類一樣與瀏覽器、命令列工具、API、試算表和文件互動,結果由決定論或 LLM 協助的驗證器進行驗證。


主要特色(如 README 所述)

特色 詳細
任務集 107 個任務,涵蓋 CLI、瀏覽器、檔案和 API/MCP 互動。分為三個能力切片:65 個純文字任務、20 個支援瀏覽器+文字任務、22 個需要視覺能力的任務。
狀態化評估 每個任務在具備本地模擬服務的新容器中執行,這些服務模擬 SaaS、電商、通訊與文件系統,因此代理實際上會改變狀態(例如:建立商品清單)。
可審計輸出 執行後,框架會儲存完整的設定、執行軌跡、驗證器結果、日誌與容器元資料,支援可重現性檢查。
執行器 基準測試使用 OpenClaw 執行器(版本 2026.5.22),打包於固定版本的 Docker 鏡像中(acciolyk/accio_bench@sha256:…)。
驗證機制 每個任務都有獨立的驗證器;部分為純決定論檢查,部分使用 LLM 判定器(預設:Gemini 3.1-pro-preview)。任務僅在 所有 必要檢查均通過時才算通過。
報告的指標 通過率(通過任務數 / 107)、平均步驟數(工具呼叫次數)、平均時間(牆鐘時間)、平均 token 數(模型使用量)。
參考結果 README 包含三個執行器(Pi、OpenClaw、Accio)的快照排行榜,展示十餘個模型家族的表現(例如:Claude Opus 5 以約 61% 的通過率位居榜首)。
可擴展性 使用者可貢獻新的模擬服務;貢獻的服務最初置於 mock_services/contrib/,後續將合併至官方任務集中。
快速入門 使用 Python 3.11+ 虛擬環境安裝,拉取固定版本的 Docker 鏡像,再透過 commerce-agent-bench CLI 執行單一任務或完整套件。
可重現性契約 倉儲固定了任務集、任務定義、執行器版本與執行時鏡像(v1.3.1)。使用者被要求報告提供者、模型、判定器及其他執行時細節,以確保結果可比性。

誰可能使用它?

  • 需要在網頁 UI、CLI 或 API 上執行動作的 LLM 驅動代理的研究實驗室。
  • 希望獲得客觀、狀態化基準,以比較模型家族在電商導向工作流程上表現的 LLM 提供商。
  • 在部署至真實電商平台前,評估內部或預發佈代理的產品團隊。

如何開始(README 步驟摘要)

  1. 設定環境 – 安裝 Docker(Linux/AMD64)和 Python 3.11+。建立虛擬環境並安裝套件(pip install -e .)。
  2. 拉取基準執行時docker pull acciolyk/accio_bench@sha256:<digest>(digest 在倉儲中已固定)。
  3. 提供 API 金鑰 – 導出要測試的模型金鑰(例如 GEMINI_API_KEY),以及 LLM 判定器的金鑰(Gemini-3.1-pro-preview 使用 GEMINI_API_KEY,OpenAI/Anthropic 等使用相應金鑰)。
  4. 執行一個任務 – 例如命令使用 Gemini 3.5-flash 執行 Amazon margin floor audit 任務。
  5. 執行完整套件 – 使用 commerce-agent-bench run --config configs/openclaw_native_google_direct.yaml(可選地使用 --limit 1 進行煙霧測試)。
  6. 檢查結果 – 執行後,runs/<run_id>/ 目錄包含 summary.jsonreport.html 以及每個任務的清單檔,包含日誌、截圖與輸出產物。

授權與社群

此專案為開源(README 未列出特定授權,但倉儲包含標準貢獻與安全政策)。歡迎貢獻,特別是擴展基準覆蓋範圍的新模擬服務。團隊可應要求評估私有模型,並開放合作。


總結:Commerce Agent Bench 是一個真正的、生產級的基準,用於以可重現、可審計的方式測試 LLM 驅動代理執行端對端電商任務的能力。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案