agentscope-ai/OpenJudge
OpenJudge: A Unified Framework for Holistic Evaluation and Quality Rewards
해결하는 문제
OpenJudge는 챗봇 및 AI 에이전트와 같은 AI 애플리케이션을 체계적인 평가 워크플로우를 통해 개선하는 데 도움을 주는 오픈소스 평가 프레임워크입니다. 품질 지표를 정의하는 어려움과 대규모 평가를 수행하여 약점을 파악하고 애플리케이션 성능을 반복적으로 개선하는 문제를 해결합니다.
작동 방식
OpenJudge는 일반, 에이전트 전용, 멀티모달 영역에 걸쳐 50개 이상의 프로덕션 준비된 그레이더를 제공합니다. 사용자는 다음 네 가지 방법으로 그레이더를 생성할 수 있습니다:
- 사용자 정의: Python 인터페이스 또는 프롬프트 템플릿을 통해 규칙을 정의.
- 제로샷 평가 기준 생성: LLM을 사용해 작업 설명에서 평가 기준을 자동으로 생성.
- 데이터 기반 평가 기준 생성: 애노테이션된 데이터에서 GraderGenerator를 사용해 평가 기준을 요약.
- 판정 모델 훈련: 프롬프트만으로는 충분하지 않은 복잡한 시나리오를 위해 전용 모델을 훈련.
결과는 전체 점수로 집계되어 LangSmith 및 Langfuse와 같은 관측 플랫폼에 통합하거나, VERL과 같은 프레임워크를 통해 RL 학습의 보상 신호로 사용할 수 있습니다.
대상 사용자
LLM 기반 애플리케이션과 에이전트를 개발하고 최적화하는 개발자 및 AI 연구자에게 적합합니다. 특히 품질 평가 및 파인튜닝을 위한 보상 신호를 전문적이고 확장 가능한 방식으로 생성해야 하는 사용자에게 적합합니다.
주요 특징
- 포괄적인 그레이더 라이브러리: 의미적 품질, 에이전트 경로, 도구 호출, 이미지-텍스트 일관성 등 50개 이상의 검증된 그레이더 포함.
- 유연한 평가 기준 생성: 제로샷 및 데이터 기반 평가 기준 생성을 모두 지원.
- 통합 생태계: LangSmith, Langfuse, VERL과 원활하게 연동.
- 온라인 플레이그라운드: 설치 없이 브라우저 기반 인터페이스로 그레이더 테스트 및 평가 기준 구축 가능.
- 에이전트 라이프사이클 평가: 최종 출력뿐만 아니라 메모리, 반성, 도구 사용을 포함한 전체 프로세스 평가.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트