suyoumo/ClawProBench
ClawProBench is a live-first benchmark harness for evaluating LLM agents in the OpenClaw runtime with deterministic grading and repeated-trial reliability.
What it solves
ClawProBench는 OpenClaw 런타임 내에서 동작하는 AI 에이전트의 역량을 평가하도록 설계된 벤치마크 하니스입니다. 투명하고 실시간 실행되는 벤치마크가 필요하다는 문제를 해결하며, 결정론적 채점을 사용해 모델이 정적 데이터셋이 아닌 실제 작업에서 어떻게 성능을 발휘하는지 측정합니다.
How it works
시스템은 라이브-퍼스트 벤치마크 하니스로 동작하며, 다양한 시나리오에서 작업을 실행합니다. CLI (run.py)를 사용해 벤치마크 프로세스를 관리하며, 인벤토리 체크, 드라이 런, 전체 실행을 포함합니다. 하니스는 OpenClaw 런타임과 연결해 에이전트를 실행하고, custom_checks에 위치한 시나리오별 채점 로직을 적용해 성공 여부를 판단합니다. 3회 시도와 같은 다중 트라이 실행을 지원해 pass^3 및 pass@3과 같은 안정성 지표를 계산합니다.
Who it’s for
이 도구는 에이전트 역량을 평가하고 모델이 OpenClaw 생태계 내에서 작업을 안정적으로 수행할 수 있도록 보장하려는 AI 연구자 및 모델 개발자를 위한 것입니다.
Highlights
- Live-First Execution: 시뮬레이션 환경이 아니라 실제 OpenClaw 런타임 내에서 모델을 평가합니다.
- Deterministic Grading: 구조화된 보고서와 커스텀 체크 로직을 사용해 일관된 점수를 보장합니다.
- Comprehensive Profiles: 여러 벤치마크 프로파일 (
core,intelligence,coverage,native,full)을 제공해 빠른 순위 측정과 확장된 역량 테스트 사이의 균형을 맞춥니다. - Robust Execution: 체크포인트 재개, 크로스 환경 재개, 실행 실패 작업 재큐잉을 지원합니다.
- Detailed Metrics: 안정적인 반복 성공에 더 높은 가중치를 부여하는
FinalScore를 계산하여 일회성 성공보다 높은 점수를 부여합니다.