E-Commerce Bench는 장기적 전자상거래 운영에서 LLM 에이전트를 평가한다
TL;DR
Qwen는 E-Commerce Bench를 발표했다. 이는 10만 위안의 자본으로 여러 온라인 상점을 운영하는 일년간의 결정론적 시뮬레이션으로, 18개의 LLM 에이전트를 일곱 가지 능력 축에 걸쳐 평가하여, 최고 성능 모델조차도 일부 차원에서만 뛰어난 성과를 보였음을 보여주었다.
벤치마크 개요
- 목표: LLM 에이전트가 자연스러운 종료 지점 없이 전자상거래 사업을 지속적으로 운영할 수 있는 능력을 측정하는 것.
- 설정: 에이전트는 100,000 위안의 자본으로 시작하며, 여러 상점을 개설할 수 있으며, 365일 동안 매일 결정을 내려야 한다. 연구 분야 탐색, 공급업체 협상, 가격 설정, 상품 등록, 재고 관리, 프로모션 운영, 현금 흐름 관리 등이다.
- 데이터 소스: 실제 세계의 타오바오 및 타몰 데이터(6,886개 제품, 60개 카테고리, 576개 공급업체, 12개 상점 유형, 10개 시장 이벤트, 8개 프로모션)를 개인정보 보호를 위해 익명화한 것이다.
- 제약 조건: 하루 600분의 시간 예산; 각 도구 호출은 분 단위로 소모된다(예: 잔고 확인 = 10분, 상점 개설 = 60분). 비용은 즉시 차감되지만 수익은 배송, 에스크로, 9일의 정산 기간으로 인해 지연된다.
- 운영 세부 사항: 저장 비용은 매일 누적되며, 배송 속도는 운송 비용에 영향을 미친다. 2일 이내에 발송되지 않은 주문은 취소되며, 평판은 수요를 직접 곱해 증가시킨다.
결정론적 핵심 엔진
- 수요 모델: 완전히 결정론적; 특정 SKU의 하루 판매량은 기본 수요, 가격 탄력성, 주말 효과, 프로모션, 계절성, 이벤트, 상점 평판, 시장 수요 상한선에서 계산된다.
- 협상 커널: 공급업체의 견적, 양보, 철회 결정은 결정론적 커널에 의해 생성되며, 재현 가능성을 보장한다. LLM은 단지 커널의 결정을 자연어 대화로 변환할 뿐이며, 확률적 가격 변동 없이 다단계 협상의 느낌을 유지한다.
- 왜 결정론적인가?: 구매자와 공급업체 모두에서의 무작위성은 진정한 모델 차이를 가리고, jailbreak 공격을 가능하게 한다. 경제적 결정을 고정함으로써 에이전트의 전략적 능력만을 분리할 수 있다.
평가 프로토콜
- 실행: 각 모델당 5개의 전년도 에피소드, 총 18개의 LLM 에이전트에서 90개의 에피소드.
- 주요 지표: 연말 총 자산(초기 10만 위안의 배수). 결과는 GPT-5.6 Sol이 143만 위안(14.31배)을 달성한 반면, Qwen-3.5-Plus는 평균 110만 위안을 기록했다.
- 실패 유형: 10개의 에피소드(약 11%)가 파산으로 끝났으며, 대부분은 초기 과잉 재고와 현금 흐름 붕괴로 인한 것이다.
- 보조 축(0–1점, 별도 표기 없음):
- 협상 품질 – 공급업체의 초기 견적보다 가격을 낮추는 능력.
- 사기 회피 – 조달 비용 중 실제 사기 공급업체에 지출된 비율.
- 현금 흐름 및 자산 유지 – 일년 내내 유동성 유지 여부.
- 운영 효율성 – 도구 호출당 수익.
- 운영 실행력 – 배송, 현금 인출, 재고 등록과 같은 행동의 효과적 사용.
- 장기적 학습 – AnchorRatio로 측정되며, 반복 구매 가격이 무작위 기준 대비 얼마나 개선되었는지를 나타낸다.
주요 발견
수익 격차
- 폐쇄형 소스 모델이 수익 순위에서 압도적 우위를 차지한다. 가장 뛰어난 개방형 가중치 모델인 Qwen-3.8-Max-Preview는 4.16배의 수익을 기록했다.
- 자산 궤적은 세 가지 패턴으로 나뉜다: 지속적인 성장(상위 모델), 초기 파산(중간 실패), 초기 자본 수준 근처의 평탄한 성과(하위 모델).
협상 품질
- 어떤 모델도 공급업체의 비용 하한선까지 도달하지 못했다. Claude Opus 4.7이 가장 높은 점수(0.811)를 기록했고, Kimi K2.6은 초기 견적보다 거의 개선되지 않았다(0.596).
- 동일한 모델에 대해 여섯 가지 공급업체 행동 스타일 간 성능 변동은 작았지만, 모델 간 차이는 컸다.
사기 회피
- 사기 지출은 모델 간 160배 차이를 보였으며, 0.12%(Claude Opus 4.7)에서 20.11%(Qwen-3.5-Plus)까지 다양했다.
- 모든 모델이 단순한 ‘스크리닝 없음’ 기준(26.4%의 공급업체가 사기)보다 우수했다. 주요 차별 요소는 사기 연락처에서의 주문 전환률이었으며, 연락 횟수는 아니었다.
운영 효율성
- 도구 호출당 수익은 GPT-5.6 Sol의 363위안에서 Fable5의 479위안까지 다양했다. Fable5는 비슷한 수익을 내면서도 59.9% 적은 호출을 사용했다.
- 대부분의 호출(71.8%)은 낮은 영향력의 행동(배송, 현금 인출, 재고 등록)을 포함했으며, 조달 비용에 영향을 주는 호출은 단지 6%에 불과했다.
장기적 학습
- AnchorRatio는 반복 구매 가격이 시간이 지남에 따라 개선되는지를 측정한다. 모델 간 중앙값은 1.369(무작위보다 나쁘다)였으며, 유일하게 진정한 학습을 보인 모델은 Qwen-3.8-Max-Preview(AnchorRatio = 0.834)였다.
- 대부분의 모델은 일년 내내 구매 가격을 낮추지 못했으며, 공급업체 선택도 시뮬레이션 후반에 더 사기적인 파트너로 편향되었다.
LLM 에이전트 개발에 대한 시사점
- 단일 지표 평가는 오해를 낳는다: 수익을 극대화하는 모델은 사기 회피나 학습 측면에서 하위권에 머무를 수 있다.
- 결정론적 벤치마킹은 재현 가능하고 비교 가능한 결과를 제공하며, 전략적 능력을 확률적 노이즈로부터 분리한다.
- 다중 축 점수는 개발자가 개선할 수 있는 구체적인 약점(예: 협상, 사기 스크리닝)을 드러낸다.
- 향후 성장 여지: 각 축에서 최고 점수도 완벽(1.0)에 크게 못 미치며, 향후 LLM 에이전트의 자율적 비즈니스 운영에서 큰 발전 여지가 있음을 시사한다.
미래 방향성
- 결정론적 커널 개념을 공급망 물류, 금융 거래 등 다른 장기적 영역으로 확장하면 재현 가능한 벤치마크의 표준화가 가능하다.
- 더 풍부한 공급업체 행동 스타일과 동적 시장 충격을 추가하면 강건성 테스트가 더욱 강화된다.
- 벤치마크 환경을 오픈소스로 공개하면 커뮤니티 주도의 모델 개선과 연구소 간 비교가 가능해진다.
인용
@misc{fan2026ecommercebenchevaluatingllm,
title = {E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation},
author = {Wei Fan and Xinjie Shen and Xudong Guo and Jianhong Tu and Yang Su and Yinger Zhang and Lianghao Deng and Fengyu Wang and Baohua Dong and Yangqiu Song and Dayiheng Liu},
year = {2026},
eprint = {2608.30730},
archivePrefix = {arXiv},
primaryClass = {cs.LG},
url = {https://arxiv.org/abs/2608.30730}
}
원본 블로그 포스트에서 인용된 모든 그림은 개념적으로 여기에 재현되었으며, 벤치마크 코드와 데이터는 링크된 Qwen GitHub 저장소를 통해 이용 가능합니다.