InternLM/WildClawBench
An in-the-wild benchmark for AI agents in the OpenClaw Environment.
해결하는 문제
대부분의 AI 에이전트 벤치마크는 JSON 파싱 또는 단일 함수 호출과 같은 고립된 능력에 집중합니다. WildClawBench는 에이전트를 라이브 환경에 투입하여 자율적인 계획과 오류 복구가 필요한 복잡한 다단계 작업을 수행하게 함으로써, 실제 환경에서의 엔드 투 엔드 에이전시(agency)를 테스트해야 할 필요성을 해결합니다.
작동 방식
이 벤치마크는 6가지 카테고리(Productivity, Code, Social, Search, Creative, Safety)에 걸친 60개의 수동 제작 작업을 라이브 OpenClaw 환경 내에서 실행합니다. Docker 컨테이너를 사용하여 각 작업이 브라우저, bash, 파일 시스템과 같은 실제 도구를 갖춘 격리된 재현 가능한 환경에서 실행되도록 보장합니다. 또한 모델의 능력과 주변 스캐폴딩(scaffolding)을 분리하기 위해 4가지의 서로 다른 에이전트 하네스(OpenClaw, Claude Code, Codex CLI, Hermes Agent)를 지원합니다.
대상
단순한 지시 이행 테스트가 아닌, 실제적인 장기 워크플로우에서 모델이 어떻게 성능을 발휘하는지 측정해야 하는 자율 에이전트를 구축하는 AI 연구자 및 개발자를 위해 설계되었습니다.
주요 특징
- 실제 환경: 모의(mock) 대신 라이브 도구(브라우저, 이메일, 캘린더)를 사용합니다.
- 다양한 태스크 세트: 비디오 하이라이트 클리핑과 같은 멀티모달 작업과 문서화되지 않은 코드베이스를 디버깅하는 것과 같은 복잡한 코딩 작업이 포함됩니다.
- 멀티 하네스 평가: 서로 다른 에이전트 스캐폴딩에서 동일한 모델을 비교할 수 있습니다.
- 강건성 테스트: API 키 유출 감지 및 프롬프트 인젝션 저항과 같은 안전성 정렬(alignment) 작업이 포함됩니다。
- 재현 가능한 결과: 격리된 Docker 컨테이너를 사용하며, 실행 후에만 채점 스크립트를 주입하여 데이터 누출을 방지합니다.