Enterprise Scenarios Leaderboard: 실제 비즈니스 사례에 대한 LLM 평가

Patronus 팀은 Hugging Face와 협력하여 Enterprise Scenarios Leaderboard를 출시했습니다. 이 벤치마크는 제한된 학술 과제보다 실용적이고 실제 엔터프라이즈 사용 사례에서 대형 언어 모델(LLM)의 성능을 평가하도록 설계되었습니다.

엔터프라이즈 LLM 평가 격차 해소

기존 LLM 벤치마크는 주로 학술 데이터셋에 의존하는데, Patronus 팀은 이러한 데이터셋이 제한된 환경에서는 유용하지만 실제 비즈니스 요구와는 크게 차이가 있다고 지적합니다. Enterprise Scenarios Leaderboard는 다양한 실제 시나리오에서 LLM을 사용하는 기업들과의 대화를 바탕으로 개발되어, 비즈니스 애플리케이션에 모델을 선택하는 사용자에게 보다 실용적인 출발점을 제공합니다.

리더보드를 "게임화"하는 것을 방지하기 위해—즉 모델이 테스트 세트에 대해 미세 조정되는 경우—팀은 6개 데이터셋 중 4개를 비공개로 유지했습니다. FinanceBench와 Legal Confidentiality는 오픈소스로 남아 있는 반면, 나머지 네 작업은 전체 테스트 데이터를 공개하지 않고 작업 요구 사항을 이해하도록 돕기 위해 검증 세트만 제공합니다.

지원되는 엔터프라이즈 작업 및 메트릭

리더보드는 여섯 가지 다양한 작업에 걸쳐 모델을 평가하며, 각각 특정 메트릭을 사용해 성능을 판단합니다:

1. FinanceBench

이 작업은 문서에서 검색된 컨텍스트를 사용해 금융 질문에 답하는 모델의 능력을 측정합니다. 총 150개의 프롬프트로 구성됩니다.

  • Evaluation Metric: 정확도, GPT-3.5를 사용한 few-shot 프롬프트로 생성된 답변이 자유 형식 텍스트의 라벨과 일치하는지 확인하여 결정합니다.

2. Legal Confidentiality

LegalBench에서 추출한 100개의 라벨링된 프롬프트를 사용하여, 이 작업은 법적 사유에 대해 추론하는 LLM의 능력을 측정합니다. 모델은 간단히 "Yes" 또는 "No"로 응답하도록 요구됩니다.

  • Evaluation Metric: 정확도, 생성된 출력이 라벨과 정확히 일치하는지를 측정합니다.

3. Creative Writing

이 작업은 r/WritingPrompts Reddit 커뮤니티와 레드팀 생성으로부터 파생된 100개의 프롬프트를 사용해 스토리 작성 및 창의성을 평가합니다.

  • Evaluation Metrics: 일관성 및 흥미도, 후자는 80k Reddit 기반 참여 데이터셋으로 학습된 EnDEX 모델을 사용해 측정합니다.

4. Customer Support Dialogue

이 작업은 제공된 제품 정보와 대화 기록을 기반으로 고객 지원 질문에 답하는 능력을 100개의 프롬프트를 사용해 테스트합니다.

  • Evaluation Metrics: 참여도, 일관성, 그리고 대화 깊이. 질문에 직접 답하지 않거나, 정보가 불완전하거나, 기록에 언급된 제품을 무시하는 경우 응답은 무관하게 표시됩니다; 이러한 평가는 GPT-3.5를 사용한 few-shot 프롬프트로 수행됩니다.

5. Toxicity

안전성을 평가하기 위해 레드팀을 통해 생성된 100개의 프롬프트를 사용해 유해 정보를 유도하려 시도합니다.

  • Evaluation Metric: 독성 점수, Perspective API를 사용해 무례하거나, 불경하거나, 비합리적인 댓글을 감지하여 측정합니다.

6. Enterprise PII

이 작업은 EnterprisePII 데이터셋의 100개 프롬프트를 사용해 모델이 직원 성과 보고서와 같은 비즈니스 민감 정보를 유도하는지를 평가하여 비즈니스 안전성을 측정합니다.

  • Evaluation Metric: EnterprisePII Classifier, 기업 PII에 대한 3,000개의 라벨링된 예시로 학습된 모델. 비즈니스 민감 정보를 생성하면 실패로 간주됩니다.

제출 및 검증

리더보드에 제출되는 모델은 공개되어 있어야 하며 Hugging Face AutoClasses를 통해 로드 가능해야 합니다. 평가 코드는 오픈소스가 아니지만, 모델 생성물과 검증 세트에 대한 평가는 PatronusAI validation-results 데이터셋을 통해 제공됩니다.

Sources