Accio-org/CommerceAgentBench
CommerceAgentBench: Benchmarking Long-Horizon Agents in High-Fidelity, Stateful, and Reproducible Replicas of Real Online Services
Commerce Agent Bench – 무엇인가요
Commerce Agent Bench 는 알리바바 국제팀의 Accio 팀이 개발한, 자율형 AI 에이전트 를 평가하기 위한 벤치마크 스위트입니다. 실제 세계의 다단계 전자상거래 워크플로우를 수행할 수 있는지를 검증합니다. 일반적인 질문-응답 또는 단일 턴 테스트와 달리, 이 벤치마크는 각 작업을 격리된 Docker 컨테이너 내에서 실행하며, 실제 세계 서비스(예: 알리바바 제품 게시, Freightos 물류, Shopify 관리자)의 모크 버전을 호스팅합니다. 에이전트는 브라우저, 명령줄 도구, API, 스프레드시트, 문서와 인간이 하는 것처럼 상호작용해야 하며, 결과는 결정론적 또는 LLM 기반 검증기로 검증됩니다.
주요 기능 (README에 설명됨)
| 기능 | 세부 사항 |
|---|---|
| 작업 세트 | CLI, 브라우저, 파일, API/MCP 상호작용을 포함하는 107개 작업. 3가지 능력 슬라이스로 나뉘며, 65개의 텍스트 전용, 20개의 브라우저-텍스트 대응, 22개의 비전 필요 작업. |
| 상태 유지 평가 | 각 작업은 로컬 모크 서비스를 갖춘 새 컨테이너에서 실행되며, SaaS, 전자상거래, 메시징, 문서 시스템을 에뮬레이트하여 에이전트가 실제로 상태를 변경(예: 제품 목록 생성)할 수 있습니다. |
| 검증 가능한 출력 | 실행 후 프레임워크는 전체 구성, 실행 궤적, 검증 결과, 로그, 컨테이너 메타데이터를 저장하여 재현성 검사를 가능하게 합니다. |
| 하네스 | 벤치마크는 OpenClaw 러너(버전 2026.5.22)를 핀된 Docker 이미지(acciolyk/accio_bench@sha256:…)에 패키지화하여 사용합니다. |
| 검증 | 각 작업에는 자체 검증기가 있으며, 일부는 순수 결정론적 검사, 일부는 LLM 판정자(기본값: Gemini 3.1-pro-preview)를 사용합니다. 작업이 통과하려면 모든 필수 검사가 성공해야 합니다. |
| 보고되는 메트릭 | 합격률 (성공한 작업 수 / 107), 평균 스텝 수 (도구 호출 횟수), 평균 시간 (월클록), 평균 토큰 수 (모델 사용량). |
| 기준 결과 | README에는 세 가지 하네스(Pi, OpenClaw, Accio)의 스냅샷 리더보드가 포함되어 있으며, 10여 개의 모델 패밀리의 성능을 보여줍니다(예: Claude Opus 5가 약 61%의 합격률로 1위). |
| 확장성 | 사용자는 새로운 모크 서비스를 기여할 수 있습니다. 기여된 서비스는 먼저 mock_services/contrib/에 배치된 후 공식 작업 세트로 통합됩니다. |
| 빠른 시작 | Python 3.11+ 가상 환경에서 설치하고, 핀된 Docker 이미지를 다운로드한 후 commerce-agent-bench CLI로 단일 작업 또는 전체 스위트를 실행합니다. |
| 재현성 계약 | 리포지토리는 작업 세트, 작업 정의, 하네스 버전, 런타임 이미지(v1.3.1)를 핀합니다. 사용자는 결과를 비교할 수 있도록 프로바이더, 모델, 판정자, 기타 런타임 세부 정보를 보고하도록 요청됩니다. |
누가 사용할 수 있을까?
- 웹 UI, CLI, API에서 작동하는 LLM 기반 에이전트를 개발하는 연구소.
- 전자상거래 중심 워크플로우에서 모델 패밀리 간을 객관적으로 비교할 수 있는 상태 유지 벤치마크를 원하는 LLM 제공업체.
- 실제 전자상거래 플랫폼에 배포하기 전에 내부 또는 사전 릴리스 에이전트를 평가하는 제품 팀.
시작하기 (README 단계 요약)
- 환경 설정 – Docker(Linux/AMD64) 및 Python 3.11+. 가상 환경을 만들고 패키지를 설치(
pip install -e .). - 벤치마크 런타임 가져오기 –
docker pull acciolyk/accio_bench@sha256:<digest>(digest는 리포지토리에서 핀됨). - API 키 제공 – 테스트할 모델의 키(예:
GEMINI_API_KEY)와 LLM 판정자의 키(GEMINI_API_KEYfor Gemini-3.1-pro-preview, 또는 OpenAI/Anthropic 등에 적절한 키)를 내보냅니다. - 작업 실행 – 예: Gemini 3.5-flash로 Amazon margin floor audit 작업 실행.
- 전체 스위트 실행 –
commerce-agent-bench run --config configs/openclaw_native_google_direct.yaml사용(옵션으로--limit 1로 스모크 테스트 가능). - 결과 검토 – 실행 후
runs/<run_id>/디렉터리에summary.json,report.html, 각 작업의 매니페스트(로그, 스크린샷, 출력 아티팩트 포함)가 포함됩니다.
라이선스 및 커뮤니티
이 프로젝트는 오픈소스입니다(README에는 특정 라이선스가 명시되어 있지 않지만, 리포지토리에는 표준 기여 및 보안 정책이 포함되어 있습니다). 기여는 환영하며, 특히 벤치마크의 커버리지를 확장하는 새로운 모크 서비스의 기여를 기대합니다. 팀은 요청 시 비공개 모델 평가를 제공하며, 협업도 환영합니다.
결론: Commerce Agent Bench 는 재현성과 검증 가능성을 갖춘 진정한 프로덕션 수준의 벤치마크로, LLM 기반 에이전트가 재현 가능하고 검증 가능한 방식으로 엔드투엔드 전자상거래 작업을 수행할 수 있는 능력을 테스트합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트