E-Commerce Bench 评估 LLM agent 在长周期电商运营中的表现
TL;DR
Qwen 推出了 E‑Commerce Bench,这是一个为期一年的、确定性的模拟环境,用于模拟使用 ¥100 k 资本运行多个在线商店,并利用它来评估 18 个 LLM agent,涵盖七个能力维度,结果显示即使是表现最好的模型在某些维度上也仅表现出色。
Benchmark Overview
- Goal: 衡量 LLM agent 持续运营电商业务的能力,且没有自然停止点。
- Setup: Agent 开始时拥有 ¥100 000,可以开设多个商店,并且必须在模拟的 365 天内做出每日决策——研究品类、与供应商谈判、定价、上架、管理库存、处理促销活动以及现金流。
- Data source: 使用了脱敏后的真实淘宝和天猫数据(包含 6,886 个产品、60 个品类、576 个供应商、12 种商店类型、10 种市场事件、8 种促销活动)。
- Constraints: 每日 600 分钟的时间预算;每次工具调用都会消耗分钟数(例如,余额查询 = 10 分钟,开店 = 60 分钟)。成本会立即扣除,而收入则因物流、托管和 9 天结算期而延迟。
- Operational details: 仓储费每日累计,发货速度影响运费,两天内未发货的订单会被取消,且信誉度会直接影响需求量。
Deterministic Core Engine
- Demand model: 完全确定性;SKU 在特定日期的销售量由基础需求、价格弹性、周末效应、促销、季节性、事件、商店信誉度和市场需求上限共同计算得出。
- Negotiation kernel: 供应商报价、让步和放弃决策是由一个确定性内核生成的,以确保可重复性。LLM 仅将内核的决策转化为自然语言对话,从而在保留多轮讨价还价的感觉的同时,避免了随机的价格波动。
- Why deterministic?: 买家和供应商双方的随机性会掩盖真实的模型差异并导致越狱攻击。通过冻结经济决策,可以隔离出 agent 的战略能力。
Evaluation Protocol
- Runs: 每个模型进行五次为期一年的完整回合,18 个 LLM agent(包括开源和闭源模型)总计进行了 90 次回合。
- Primary metric: 年终总资产(初始 ¥100 k 的倍数)。结果显示从 GPT‑5.6 Sol 实现 ¥1.43 M (14.31×) 到 Qwen‑3.5‑Plus 平均仅 ¥1 100。
- Failure mode: 十个回合(约 11%)以破产结束,通常由早期过度囤货和现金流崩溃引起。
- Secondary axes (除非另有说明,否则评分 0–1):
- Negotiation quality – 压低价格低于供应商初始报价的能力。
- Fraud avoidance – 采购支出中流向已知欺诈供应商的比例。
- Cash‑flow & solvency – 全年维持流动性的能力。
- Operational efficiency – 每次工具调用的利润。
- Operations execution – 有效使用发货、提现、上架等操作。
- Learning over the horizon – 通过 AnchorRatio 衡量,即重复购买价格相对于随机基准的改善程度。
Key Findings
Profit Disparities
- 闭源模型在利润排行榜上占据主导地位;表现最好的开源模型 (Qwen‑3.8‑Max‑Preview) 实现了 4.16× 的回报。
- 资产轨迹分为三种模式:稳步增长(顶尖模型)、早期破产(中端失败案例)以及在初始资本附近持平(低端模型)。
Negotiation Quality
- 没有模型能达到供应商的成本底线。Claude Opus 4.7 评分最高 (0.811),而 Kimi K2.6 几乎没有比初始报价更便宜 (0.596)。
- 对于给定的模型,在六种供应商行为风格下的表现差异很小,但不同模型之间的差异很大。
Fraud Avoidance
- 欺诈性支出在不同模型间存在 160 倍 的差异,从 0.12 % (Claude Opus 4.7) 到 20.11 % (Qwen‑3.5‑Plus)。
- 所有模型都比“无筛选”基准(26.4% 的供应商是欺诈性的)表现更好。主要的区别在于来自欺诈联系人的订单转化率,而非联系人数量。
Operational Efficiency
- 每次工具调用的利润从 ¥363 (GPT‑5.6 Sol) 到 ¥479 (Fable5) 不等。Fable5 在调用次数减少 59.9% 的情况下生成了相当的利润。
- 大多数调用 (71.8%) 涉及低影响操作(发货、提现、上架),而只有 6% 影响采购成本。
Long‑Horizon Learning
- AnchorRatio 量化了重复购买价格是否随时间改善。模型的中位数是 1.369 (比随机基准更差),且只有 Qwen‑3.8‑Max‑Preview 表现出了真正的学习能力 (AnchorRatio = 0.834)。
- 大多数模型在一年内没有降低购买价格;供应商选择也随着模拟的进行而逐渐向更多欺诈性合作伙伴转移。
Implications for LLM Agent Development
Single‑metric evaluation is misleading: 一个模型可能在利润最大化方面表现出色,但在欺诈规避避或学习能力方面排名靠后。
Deterministic benchmarking 提供可重复的对比结果,并将战略能力从随机噪声中隔离出来。
Multi‑axis scoring 突出了显示出特定弱点(例如,谈判- 欺诈筛选)开发者可以针对性地改进。
Room for progress: 即使是每个维度上的最高分也远未达到完美 (1.0),表明未来 LLM agent 在自主业务运营能力方面仍有巨大的提升空间。
Future Directions
将确定性内核的概念扩展到其他长周期领域(如供应链物流、金融交易)可以实现标准化、可重复的评估基准准则。
增加更丰富的供应商行为风格和动态市场冲击,测试进一步的提升鲁棒性。
Open‑sourcing the benchmark environment 会使社区驱动的模型改进和跨实验室对比变得更加容易。
Citation
@misc{fan2026ecommercebenchevaluatingllm,
title = {E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation},
author = {Wei Fan and Xinjie Shen and Xudong Guo and Jianhong Tu and Yang Su and Yinger Zhang and Lianghao Deng and Fengyu Wang and Baohua Dong and Yangqiu Song and Dayiheng Liu},
year = {2026},
eprint = {2608.30730},
archivePrefix = {arXiv},
primaryClass = {cs.LG},
url = {https://arxiv.org/abs/2608.30730}
}
All figures referenced in the original blog post are reproduced here conceptually; the benchmark code and data are available via the linked Qwen GitHub repository.