harveyai/harvey-labs

A benchmark built to evaluate and improve agent capabilities for supporting legal work.

해결하는 문제

LLM 기반 에이전트가 실제 법무 업무를 얼마나 잘 처리할 수 있는지 표준화된 방식으로 평가할 수 있도록 제공합니다. 법무 업무는 복잡하고 높은 정확성이 요구되므로, 이 벤치마크는 개발자가 다양한 법무 분야에서 에이전트의 성능을 측정하는 데 도움을 줍니다.

작동 방식

이 프로젝트는 두 가지 주요 구성 요소로 구성됩니다: 작업 데이터셋(구체적인 지침, 관련 문서, 평가 기준 포함)과 실행 허브(execution harness). 이 허브를 사용하면 개발자가 에이전트를 작업에 대해 실행하고 정의된 기준에 따라 자동으로 성능을 평가할 수 있습니다.

대상 사용자

법무 분야 전용 LLM 에이전트를 개발하는 AI 연구자 및 개발자에게 적합합니다.

주요 특징

  • 24개 이상의 법무 분야에 걸쳐 1,600개 이상의 작업을 포괄.
  • 에이전트의 실행과 평가를 위한 전용 실행 허브 포함.
  • 모든 항목 통과 기준 평가 시스템과 LLM 심사관을 활용한 평가.
  • 대시보드를 통한 에이전트 성능 비교를 위한 오픈소스 프레임워크.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트