suyoumo/ClawProBench
ClawProBench is a live-first benchmark harness for evaluating LLM agents in the OpenClaw runtime with deterministic grading and repeated-trial reliability.
해결하는 문제
ClawProBench는 OpenClaw 런타임 내에서 작동하는 AI 에이전트의 능력을 평가하기 위해 설계된 벤치마크 허브입니다. 정적 평가에서 벗어나 실제 런타임 환경에서 에이전트가 실제로 어떻게 작동하는지 테스트하기 위해 투명하고 실시간 실행 평가 및 결정론적 채점 기능을 제공합니다.
작동 방식
이 시스템은 core, intelligence, native 등의 벤치마크 프로파일을 사용하여 AI 에이전트를 다양한 시나리오에 통과시킵니다. 3회 시도(3-try)와 같은 다중 시도 실행을 지원하여 안정성과 성공률을 측정합니다. 허브는 OpenClaw CLI를 통해 에이전트 실행을 관리하고, 트레이스를 추적하며, 커스텀 체커를 포함한 결정론적 채점 로직을 적용하여 작업이 성공적으로 완료되었는지 판단합니다.
대상 사용자
AI 연구자, 모델 개발자, 에이전트 프레임워크를 사용하는 개발자 중 실시간 런타임 에이전트 작업에서 모델의 성능을 엄격하게 테스트하고 순위를 매기고 싶은 분들에게 적합합니다.
주요 특징
- 라이브 실행 우선: 정적 데이터셋이 아닌 OpenClaw 런타임 내에서 모델을 직접 평가합니다.
- 포괄적인 시나리오 세트: 6개 도메인에 걸쳐 102개의 활성 시나리오와 추가적인 육성 중인 시나리오를 포함합니다.
- 결정론적 채점: 구조화된 보고서와 커스텀 체커를 사용하여 일관되고 재현 가능한 결과를 보장합니다.
- 고급 메트릭: 안정적인 반복 성공(pass^3)과 전반적인 품질을 가중치 부여하는
FinalScore를 구현합니다. - 강력한 실행 복구: 체크포인트 재시작 및 실패한 실행만 재실행하여 평가 비용을 최적화합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트