E-Commerce Bench evaluates LLM agents on long‑horizon e‑commerce operations
TL;DR
Qwen 推出了 E‑Commerce Bench,這是一個為期一年的、確定性的模擬,模擬以 ¥100 k 資本經營多個線上商店,並以此評估了 18 個 LLM agent,涵蓋七個能力維度,結果顯示即使是頂尖模型在某些維度上也僅能表現出部分優勢。
Benchmark Overview
- Goal: 衡量 LLM agent 能夠持續經營電商業務的能力,且沒有自然的停止點。
- Setup: Agent 從 ¥100 000 開始,可以開設多個商店,且必須在模擬的 365 天期間內做出每日決策——研究類別、與供應商談判、定價、上架、管理庫存、處理促銷活動以及現金流——。
- Data source: 使用經過脫敏處理的真實淘寶與天貓數據(6,886 個產品、60 個類別、576 個供應商、12 種商店類型、10 種市場事件、8 種促銷活動)。
- Constraints: 每日 600 分鐘的時間預算;每次工具調用(tool call)都會消耗分鐘數(例如:餘額檢查 = 10 分鐘,開店 = 60 分鐘)。成本會立即扣除,而收入則因物流、託管與 9 天結算期而有所延遲。
- Operational details: 倉儲費用每日累計,物流速度會影響運費,兩天內未發貨的訂單會被取消,且商店聲譽會直接影響需求量。
Deterministic Core Engine
- Demand model: 完全確定性;特定日期的 SKU 銷售量是根據基礎需求、價格彈性、週末效應、促銷、季節性、事件、商店聲譽以及市場需求上限來計算的。
- Negotiation kernel: 供應商報價、讓步與放棄決策是由一個確定性核心(kernel)生成的,以確保可重複性。LLM 僅將核心的決策渲染成自然語言對話,從而在保留多輪談判的感覺之餘,避免了隨機價格變動。
- Why deterministic?: 在買家與供應商兩端引入隨機性會掩蓋真實的模型差異,並可能導致越獄攻擊(jailbreak exploits)。固定經濟決策可以隔離出 agent 的策略性能力。
Evaluation Protocol
- Runs: 每個模型進行五次完整的年度回合,18 個 LLM agent(包括開源與閉源模型)總計進行了 90 次回合。
- Primary metric: 年底總資產(初始 ¥100 k 的倍數)。結果從 GPT‑5.6 Sol 達到 ¥1.43 M (14.31×) 到 Qwen‑3.5‑Plus 平均 ¥1 100 之間不等。
- Failure mode: 十次回合(約 11%)以破產結束,通常是由於早期過度囤貨與現金流崩潰所致。
- Secondary axes (評分 0–1,除非另有說明):
- Negotiation quality – 壓低價格低於供應商初始報價的能力。
- Fraud avoidance – 向已知詐騙供應商進行採購支出佔總支出的比例。
- Cash‑flow & solvency – 全年維持流動性的能力。
- Operational efficiency – 每次工具調用的利潤。
- Operations execution – 有效使用如發貨、提現與庫存上架等行動。
- Learning over the horizon – 以 AnchorRatio 衡量,即重複購買價格相對於隨機基準線的改善程度。
Key Findings
Profit Disparities
- 閉源模型在利潤排行榜上佔據主導地位;表現最好的開源模型 (Qwen‑3.8‑Max‑Preview) 實現了 4.16× 的回報。
- 資產軌跡可分為三種模式:穩定增長(頂尖模型)、早期破產(中階失敗案例)以及在初始資本附近持平(低階模型)。
Negotiation Quality
- 沒有任何模型能達到供應商的成本底線。Claude Opus 4.7 獲得最高分 (0.811),而 Kimi K2.6 僅能比初始報價稍有改善 (0.596)。
- 在給定的模型下,六種供應商行為風格的表現差異很小,但在不同模型之間差異很大。
Fraud Avoidance
- 詐騙支出在不同模型間存在 160 倍 的差異,從 0.12 % (Claude Opus 4.7) 到 20.11 % (Qwen‑3.5‑Plus) 不等。
- 所有模型表現都優於「無篩選」的基準線(26.4% 的供應商是詐騙者)。主要差異點在於來自詐騙接觸點的訂單轉換率,而非接觸點的數量。
Operational Efficiency
- 每次工具調用的利潤從 ¥363 (GPT‑5.6 Sol) 到 ¥479 (Fable5) 不等。Fable5 產生的利潤相當,卻使用了 59.9 % Fewer calls。
- 大部分調用(71.8%)涉及低影響行動(發貨、提現、庫存上架),而僅 6% 影響採購成本。
Long‑Horizon Learning
- AnchorRatio 量化了重複購買價格是否隨時間改善。模型的中位數為 1.369(比隨機更差),且只有 Qwen‑3.8‑Max‑Preview 展現了真正的學習能力 (AnchorRatio = 0.834)。
- 大部分模型在一年內並未降低購買價格;供應商選擇也隨模擬進行而逐漸向更多詐騙夥伴轉向。
Implications for LLM Agent Development
- Single‑metric evaluation is misleading: 一個模型在利潤最大化時,可能在詐騙規避避險或學習能力上排名墊底。
- Deterministic benchmarking 提供可重複的結果,並能將策略性能力從隨機噪聲中隔離出來。
- Multi‑axis scoring 突顯出開發者可以針對性改進的特定弱點(例如:談判、詐騙篩選)。
- Room for progress: 即使是各個維度上的最高分也遠未達到完美 (1.0),這表示未來 LLM agent 在自主業務經營的獲得空間很大。
Future Directions
- 將確定性核心的概念擴展到其他長週期領域(如:供應鏈物流、金融交易)可以標準化可重複的驗證基準。
- 增加更豐富的供應商供應行為風格與動態市場衝擊,可以進一步測試魯棒性。
- 開源 E-Commerce Bench 模擬環境,可以實現社群驅動的模型進步與跨實驗室的比較。
Citation
@misc{fan2026ecommercebenchevaluatingllm,
title = {E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation},
author = {Wei Fan and Xinjie Shen and Xudong Guo and Jianhong Tu and Yang Su and Yinger Zhang and Lianghao Deng and Fengyu Wang and Baohua Dong and Yangqiu Song and Dayiheng Liu},
year = {2026},
eprint = {2608.30730},
archivePrefix = {arXiv},
primaryClass = {cs.LG},
url = {https://arxiv.org/abs/2608.30730}
}
All figures referenced in the original blog post are reproduced here conceptually; the benchmark code and data are available via the linked Qwen GitHub repository.