InternLM/WildClawBench
An in-the-wild benchmark for AI agents in the production harness.
What it solves
WildClawBench는 단순한 기능 호출(function calling)이나 JSON 파싱과 같은 고립된 능력 테스트를 넘어, AI 에이전트가 복잡하고 엔드투엔드(end-to-end) 방식의 실제 업무를 수행할 수 있는지 평가하기 위해 설계되었습니다. 이는 자율적인 계획 수립, 오류 복구, 멀티모달 합성을 요구하는 장기적 과업(long-horizon tasks)을 실제 환경에서 테스트함으로써, 벤치마크 점수와 실제 유용성 사이의 간극을 해결합니다.
How it works
에이전트는 웹 브라우저, bash terminal, 파일 시스템, 이메일, 캘린더와 같은 실제 도구를 갖춘 개인용 AI 비서 프레임워크인 OpenClaw 환경에 배포됩니다. 이 벤치마크는 6가지 카테고리(Productivity, Code Intelligence, Social Interaction, Search & Retrieval, Creative Synthesis, Safety Alignment)에 걸쳐 60개의 독창적이고 수작업으로 제작된 과업으로 구성됩니다.
재현성을 보장하고 데이터 누출을 방지하기 위해 각 과업은 격리된 Docker container에서 실행됩니다. 시스템은 4가지의 서로 다른 에이전트 하네스(OpenClaw, Claude Code, Codex CLI, Hermes Agent)를 지원하여, 연구자들이 기반 LLM의 능력과 에이전트 프레임워크가 제공하는 스캐폴딩(scaffolding)을 구분할 수 있도록 합니다.
Who it’s for
이 도구는 복잡하고 다단계 워크플로우에서 모델의 성능을 측정할 수 있는 엄격하고 실질적인 방법이 필요한 에이전트 시스템 구축 AI 연구자 및 개발자를 위한 것입니다.
Highlights
- Real-world environments: 모의(mock) 대신 실제 도구를 사용하여 실제 사용자 워크플로우를 시뮬레이션합니다.
- Long-horizon tasks: 10-20분간의 실행 시간과 10-60회 이상의 도구 호출을 포함하는 워크플로우를 테스트합니다.
- Multi-modal evaluation: 비디오 이해, 이미지 생성 및 교차 모달 합성을 요구하는 과업을 포함합니다.
- Harness comparison: 모델 성능과 프레임워크 효율성을 분리하기 위해 여러 에이전트 스캐폴딩을 지원합니다.
- Isolated execution: 일관되고 재현 가능한 결과를 보장하기 위해 각 과업에 Docker container를 사용합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트