Accio-org/CommerceAgentBench
CommerceAgentBench: Benchmarking Long-Horizon Agents in High-Fidelity, Stateful, and Reproducible Replicas of Real Online Services
Commerce Agent Bench – 是什麼
Commerce Agent Bench 是由阿里巴巴國際團隊的 Accio 團隊所開發的基準測試套件,用於評估需要執行真實世界、多步驟電商工作流程的 自主 AI 代理。與典型的問答或單回合測試不同,此基準測試在隔離的 Docker 容器中執行每個任務,容器內託管真實世界服務的模擬版本(例如:阿里巴巴產品發佈、Freightos 物流、Shopify 管理後台)。代理必須像人類一樣與瀏覽器、命令列工具、API、試算表和文件互動,結果由決定論或 LLM 協助的驗證器進行驗證。
主要特色(如 README 所述)
| 特色 | 詳細 |
|---|---|
| 任務集 | 107 個任務,涵蓋 CLI、瀏覽器、檔案和 API/MCP 互動。分為三個能力切片:65 個純文字任務、20 個支援瀏覽器+文字任務、22 個需要視覺能力的任務。 |
| 狀態化評估 | 每個任務在具備本地模擬服務的新容器中執行,這些服務模擬 SaaS、電商、通訊與文件系統,因此代理實際上會改變狀態(例如:建立商品清單)。 |
| 可審計輸出 | 執行後,框架會儲存完整的設定、執行軌跡、驗證器結果、日誌與容器元資料,支援可重現性檢查。 |
| 執行器 | 基準測試使用 OpenClaw 執行器(版本 2026.5.22),打包於固定版本的 Docker 鏡像中(acciolyk/accio_bench@sha256:…)。 |
| 驗證機制 | 每個任務都有獨立的驗證器;部分為純決定論檢查,部分使用 LLM 判定器(預設:Gemini 3.1-pro-preview)。任務僅在 所有 必要檢查均通過時才算通過。 |
| 報告的指標 | 通過率(通過任務數 / 107)、平均步驟數(工具呼叫次數)、平均時間(牆鐘時間)、平均 token 數(模型使用量)。 |
| 參考結果 | README 包含三個執行器(Pi、OpenClaw、Accio)的快照排行榜,展示十餘個模型家族的表現(例如:Claude Opus 5 以約 61% 的通過率位居榜首)。 |
| 可擴展性 | 使用者可貢獻新的模擬服務;貢獻的服務最初置於 mock_services/contrib/,後續將合併至官方任務集中。 |
| 快速入門 | 使用 Python 3.11+ 虛擬環境安裝,拉取固定版本的 Docker 鏡像,再透過 commerce-agent-bench CLI 執行單一任務或完整套件。 |
| 可重現性契約 | 倉儲固定了任務集、任務定義、執行器版本與執行時鏡像(v1.3.1)。使用者被要求報告提供者、模型、判定器及其他執行時細節,以確保結果可比性。 |
誰可能使用它?
- 需要在網頁 UI、CLI 或 API 上執行動作的 LLM 驅動代理的研究實驗室。
- 希望獲得客觀、狀態化基準,以比較模型家族在電商導向工作流程上表現的 LLM 提供商。
- 在部署至真實電商平台前,評估內部或預發佈代理的產品團隊。
如何開始(README 步驟摘要)
- 設定環境 – 安裝 Docker(Linux/AMD64)和 Python 3.11+。建立虛擬環境並安裝套件(
pip install -e .)。 - 拉取基準執行時 –
docker pull acciolyk/accio_bench@sha256:<digest>(digest 在倉儲中已固定)。 - 提供 API 金鑰 – 導出要測試的模型金鑰(例如
GEMINI_API_KEY),以及 LLM 判定器的金鑰(Gemini-3.1-pro-preview 使用GEMINI_API_KEY,OpenAI/Anthropic 等使用相應金鑰)。 - 執行一個任務 – 例如命令使用 Gemini 3.5-flash 執行 Amazon margin floor audit 任務。
- 執行完整套件 – 使用
commerce-agent-bench run --config configs/openclaw_native_google_direct.yaml(可選地使用--limit 1進行煙霧測試)。 - 檢查結果 – 執行後,
runs/<run_id>/目錄包含summary.json、report.html以及每個任務的清單檔,包含日誌、截圖與輸出產物。
授權與社群
此專案為開源(README 未列出特定授權,但倉儲包含標準貢獻與安全政策)。歡迎貢獻,特別是擴展基準覆蓋範圍的新模擬服務。團隊可應要求評估私有模型,並開放合作。
總結:Commerce Agent Bench 是一個真正的、生產級的基準,用於以可重現、可審計的方式測試 LLM 驅動代理執行端對端電商任務的能力。
相關
- 專案
- 專案
- 專案
- 專案
- 專案