claw-eval/claw-eval
Claw-Eval is an evaluation harness for evaluating LLM as agents. All tasks verified by humans.
해결하는 문제
Claw-Eval은 기초 모델의 일반적인 에이전트 능력을 평가하기 위한 신뢰할 수 있고 재현 가능한 프레임워크를 제공합니다. 모델의 성능이 우연에 의한 것인지 확인하기 위해, 여러 시도에서 일관된 성공을 요구함으로써 '운 좋은 실행' 문제를 해결합니다.
작동 방식
이 프로젝트는 일반 생산성, 다중 모달 인식, 다단계 대화 등 9개 카테고리에 걸쳐 300개의 인간 검증된 작업 데이터셋을 사용합니다. "Pass^3" 방법론을 적용하여, 세 번의 독립적인 시도 모두에서 성공해야만 작업이 통과로 인정됩니다. 평가는 완료성, 안전성, 강건성이라는 세 가지 차원에서 전체 트래잭션 감사 방식으로 수행됩니다.
대상 사용자
이 도구는 자율 에이전트 및 기초 모델을 개발하는 AI 연구자 및 개발자들을 위한 것으로, 에이전트 능력을 벤치마킹하기 위해 엄격하고 과학적인 기반을 필요로 하는 분들에게 적합합니다.
주요 특징
- Pass^3 메트릭: 우연한 결과를 제거하기 위해 3회 연속 성공이 필요합니다.
- 포괄적인 작업 세트: 일반, 다중 모달, 다단계 분할에 걸쳐 300개의 작업이 포함됩니다.
- 트래잭션 감사: 완료성, 안전성, 강건성 측면에서 에이전트를 평가합니다.
- 다중 모달 지원: 웹페이지 생성, 동영상 질의응답, 문서 추출 등 다양한 작업을 포함합니다.
- 사전 통합: 사전 격리 및 전체 추적 기능을 지원하여 평가의 투명성을 보장합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트