Accio-org/CommerceAgentBench
CommerceAgentBench: Benchmarking Long-Horizon Agents in High-Fidelity, Stateful, and Reproducible Replicas of Real Online Services
Commerce Agent Bench – 是什么
Commerce Agent Bench 是由阿里巴巴国际团队的 Accio 团队创建的基准测试套件,用于评估需要执行真实世界、多步骤电商工作流的 自主 AI 代理。与典型的问答或单轮测试不同,该基准测试在隔离的 Docker 容器中运行每个任务,容器内托管了真实世界服务的模拟版本(例如,阿里巴巴产品发布、Freightos 物流、Shopify 管理后台)。代理必须像人类一样与浏览器、命令行工具、API、电子表格和文档进行交互,结果由确定性或 LLM 辅助的验证器进行验证。
主要特性(如 README 所述)
| 特性 | 详情 |
|---|---|
| 任务集 | 107 个任务,涵盖 CLI、浏览器、文件和 API/MCP 交互。分为三个能力子集:65 个纯文本任务,20 个支持浏览器+文本任务,22 个需要视觉能力的任务。 |
| 状态化评估 | 每个任务在带有本地模拟服务的新容器中运行,这些服务模拟 SaaS、电商、消息和文档系统,因此代理实际上会改变状态(例如,创建商品列表)。 |
| 可审计输出 | 运行结束后,框架会保存完整的配置、执行轨迹、验证器结果、日志和容器元数据,支持可复现性检查。 |
| 运行器 | 基准测试使用 OpenClaw 运行器(版本 2026.5.22),打包在固定版本的 Docker 镜像中(acciolyk/accio_bench@sha256:…)。 |
| 验证机制 | 每个任务都有独立的验证器;部分验证器为纯确定性检查,部分使用 LLM 判定器(默认:Gemini 3.1-pro-preview)。任务仅在 所有 必要检查均通过时才算通过。 |
| 报告的指标 | 通过率(通过任务数 / 107)、平均步骤数(工具调用次数)、平均时间(墙钟时间)、平均 token 数(模型使用量)。 |
| 参考结果 | README 包含三个运行器(Pi、OpenClaw、Accio)的快照排行榜,展示了十余个模型家族的表现(例如,Claude Opus 5 以约 61% 的通过率位居榜首)。 |
| 可扩展性 | 用户可贡献新的模拟服务;贡献的服务最初置于 mock_services/contrib/,之后将合并到官方任务集中。 |
| 快速入门 | 使用 Python 3.11+ 虚拟环境安装,拉取固定版本的 Docker 镜像,然后通过 commerce-agent-bench CLI 运行单个任务或完整套件。 |
| 可复现性契约 | 仓库固定了任务集、任务定义、运行器版本和运行时镜像(v1.3.1)。用户被要求报告提供方、模型、判定器及其他运行时细节,以确保结果可比性。 |
谁可能使用它?
- 需要在网页 UI、CLI 或 API 上执行动作的 LLM 驱动代理的研究实验室。
- 希望获得客观、状态化基准,以比较模型家族在电商导向工作流上表现的 LLM 提供商。
- 在部署到真实电商平台前,评估内部或预发布代理的产品团队。
如何开始(README 步骤摘要)
- 设置环境 – 安装 Docker(Linux/AMD64)和 Python 3.11+。创建虚拟环境并安装包(
pip install -e .)。 - 拉取基准运行时 –
docker pull acciolyk/accio_bench@sha256:<digest>(digest 在仓库中已固定)。 - 提供 API 密钥 – 导出要测试的模型的密钥(例如
GEMINI_API_KEY),以及 LLM 判定器的密钥(Gemini-3.1-pro-preview 使用GEMINI_API_KEY,OpenAI/Anthropic 等使用相应密钥)。 - 运行一个任务 – 示例命令使用 Gemini 3.5-flash 运行 Amazon margin floor audit 任务。
- 运行完整套件 – 使用
commerce-agent-bench run --config configs/openclaw_native_google_direct.yaml(可选地使用--limit 1进行烟雾测试)。 - 检查结果 – 运行结束后,
runs/<run_id>/目录包含summary.json、report.html以及每个任务的清单文件,包含日志、截图和输出产物。
许可与社区
该项目为开源(README 未列出具体许可证,但仓库包含标准贡献和安全政策)。欢迎贡献,尤其是扩展基准覆盖范围的新模拟服务。团队可应要求评估私有模型,并开放合作。
总结:Commerce Agent Bench 是一个真正的、生产级的基准,用于以可复现、可审计的方式测试 LLM 驱动代理执行端到端电商任务的能力。
相关
- 项目
- 项目
- 项目
- 项目
- 项目