harveyai/harvey-labs
A benchmark built to evaluate and improve agent capabilities for supporting legal work.
해결하는 문제
LLM 기반 에이전트가 실제 법무 업무를 얼마나 잘 처리할 수 있는지 표준화된 방식으로 평가할 수 있도록 제공합니다. 법무 업무는 복잡하고 높은 정확성이 요구되므로, 이 벤치마크는 개발자가 다양한 법무 분야에서 에이전트의 성능을 측정하는 데 도움을 줍니다.
작동 방식
이 프로젝트는 두 가지 주요 구성 요소로 구성됩니다: 작업 데이터셋(구체적인 지침, 관련 문서, 평가 기준 포함)과 실행 허브(execution harness). 이 허브를 사용하면 개발자가 에이전트를 작업에 대해 실행하고 정의된 기준에 따라 자동으로 성능을 평가할 수 있습니다.
대상 사용자
법무 분야 전용 LLM 에이전트를 개발하는 AI 연구자 및 개발자에게 적합합니다.
주요 특징
- 24개 이상의 법무 분야에 걸쳐 1,600개 이상의 작업을 포괄.
- 에이전트의 실행과 평가를 위한 전용 실행 허브 포함.
- 모든 항목 통과 기준 평가 시스템과 LLM 심사관을 활용한 평가.
- 대시보드를 통한 에이전트 성능 비교를 위한 오픈소스 프레임워크.
관련
- 프로젝트
InternLM/WildClawBench브라우저 및 bash terminal과 같은 도구를 사용하여 실제 환경에서 복잡하고 실제적인 과업을 수행하는 AI 에이전트의 능력을 테스트하는 엔드투엔드 에이전트 벤치마크입니다.
- 프로젝트
- 프로젝트
TIGER-AI-Lab/ClawBenchClawBench는 여행 예약, 음식 주문 등 281개의 실제 웹 작업을 평가하는 오픈소스 벤치마크입니다. 작업 사양, 다층 트레이스 기록기, LLM 평가자(deepseek-v4-pro)를 제공하여 성공 여부를 점수화합니다. `pip install clawbench-eval`로 설치하고, 모델과 평가자 API 키를 설정한 후 Docker/Podman 기반 Chromium 환경에서 작업을 실행합니다. 결과는 공개 리더보드에 게시되며, 전체 데이터는 Hugging Face에서 사용 가능합니다.
- 프로젝트
harbor-framework/harborHarbor는 AI 에이전트와 언어 모델의 벤치마크를 실행하고 확장할 수 있는 Python 프레임워크입니다. `pip`/`uv`를 통해 설치할 수 있으며, CLI (`harbor run`)를 통해 데이터셋 (예: Terminal‑Bench‑2.0), 에이전트 (Claude‑Code, OpenHands, 등), 모델을 지정하고 로컬 또는 클라우드 제공업체 (Daytona, Modal, 등)에서 구성 가능한 병렬성으로 벤치마크를 실행합니다. 또한 커스텀 벤치마크 생성 및 RL roll‑outs 생성을 지원합니다.
- 프로젝트
zli12321/LHTBLong‑Horizon Terminal‑Bench (LHTB)는 Docker 기반 터미널에서 수백 단계에 걸쳐 지속적으로 작업할 수 있는 LLM 에이전트의 능력을 측정하는 46개 작업 벤치마크입니다. 오픈소스 Harbor 하네스의 패치 버전을 제공하여 "타임아웃까지 계속" 루프와 격리된 검증기 환경을 추가해 에이전트의 부정행위를 방지합니다. 현재 최전선 모델들도 과제의 소수만 해결할 뿐이므로, 자율 AI 에이전트를 위한 어려운, 최전선 수준의 평가 도구임을 입증합니다.