braintrustdata/autoevals

AutoEvals is a tool for quickly and easily evaluating AI model outputs using best practices.

해결하는 문제

Autoevals는 AI 모델 출력을 평가하기 위한 통합 인터페이스를 제공하여 일반적인 평가 메트릭을 수동으로 구현할 필요를 없앱니다. 스코어 정규화(0에서 1 사이로 스케일링) 및 모델이 평가한 출력을 파싱하는 과정을 단순화하여, 실제로 디버깅이나 조정이 어려운 문제를 해결합니다.

작동 방식

이 라이브러리는 입력, 출력, 기대값을 받아 스코어를 생성하는 여러 평가 방법 카테고리를 통합합니다.

  • LLM-as-a-judge: 사실성, 안전성, 요약 등 주관적인 작업을 모델을 사용해 평가합니다.
  • RAG 평가: 컨텍스트 정밀도, 재현율, 충실도와 같은 리트리ieval-증강 생성(RAG) 전용 메트릭.
  • 히ュ리스틱 및 통계적: 레벤슈타인 거리, BLEU, 정확 일치와 같은 전통적 메트릭.
  • 사용자 정의 스코어러: 사용자는 커스텀 프롬프트를 사용한 LLM 기반 분류기나 비-LLM 스코어링 함수를 직접 정의할 수 있습니다.

OpenAI 호환 API 또는 Braintrust Gateway를 통해 여러 AI 제공업체를 지원하며, 캐싱 및 관측성 기능도 제공합니다.

대상 사용자

모델 성능을 정량적으로 측정하고 프롬프트 또는 RAG 파이프라인을 반복 개선해야 하는 AI 애플리케이션 개발자.

주요 특징

  • 다국어 지원: Python과 TypeScript 모두에서 사용 가능.
  • 통합 인터페이스: 다양한 평가 방법에 걸쳐 일관된 API 제공.
  • 확장성: 커스텀 모델 기반 평가 또는 간단한 히ュ리스틱 스코어러를 쉽게 생성 가능.
  • 포괄적인 메트릭 세트: RAG, 일반 LLM 작업, 임베딩 유사도 등 다양한 사전 구축된 스코어러 포함.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트