alphadl/AdaRubrics

AdaRubric: Adaptive Dynamic Rubric Evaluator for Agent Trajectories

해결하는 문제

AdaRubric은 LLM 에이전트를 평가할 때 고정된 평가 기준(예: "유용성" 또는 "안전성")이 실패하는 문제를 해결합니다. 다양한 에이전트 작업은 서로 다른 성공 기준을 필요로 하며, 예를 들어 코드 디버깅에서는 "정확성", 웹 탐색에서는 "행동 효율성"이 요구되기 때문에, 일괄적인 평가 기준은 품질을 잘못 측정하는 경향이 있습니다. AdaRubric은 작업에 맞는 평가 기준과 밀도 높은 보상 신호를 생성함으로써 에이전트의 경로를 더 정확하게 평가할 수 있도록 합니다.

작동 방식

이 프로젝트는 세 단계의 파이프라인을 구현합니다:

  1. 평가 기준 생성기: 특정 작업 설명에 기반하여 LLM을 사용해 직교하는 평가 차원과 5점 척도 평가 기준 세트를 생성합니다.
  2. 경로 평가기: 생성된 모든 차원에서 에이전트의 각 단계(Thought $\rightarrow$ Action $\rightarrow$ Observation)를 평가하여 점수와 신뢰도 가중치를 할당합니다.
  3. 데이터 필터: 다양한 전략을 사용하여 훈련용으로 고품질 데이터를 선별합니다. 특히 DimensionAwareFilter는 단일 핵심 차원에서 치명적인 실패가 평균 점수의 높음으로 가려지는 것을 방지합니다.

대상 사용자

LLM 에이전트를 훈련하는 연구자 및 개발자에게 적합합니다. 보상 학습(DPO 또는 PPO 등)을 위해 신뢰할 수 있는 평가 지표와 고품질 선호 쌍이 필요한 경우에 유용합니다.

주요 특징

  • 작업 적응형: 고정된 벤치마크에 의존하지 않고, 실시간으로 맞춤형 평가 기준을 생성합니다.
  • 밀도 높은 피드백: 최종 단일 등급이 아니라, 단계별, 차원별로 점수를 제공합니다.
  • 유연한 집계: 작업의 중요도에 따라 가중 평균, 기하 평균, 최소 점수 집계 방식을 지원합니다.
  • 실증된 성과: WebArena, ToolBench, AgentBench에서 DPO 작업 성공률이 향상되었으며, 인간 평가와의 상관관계도 개선되었습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트