AraGen 벤치마크 및 리더보드: 아랍어 LLM을 위한 3C3H 평가 도입
TL;DR
Hugging Face는 아랍어 대형 언어 모델을 위한 생성 작업 벤치마크 및 리더보드인 AraGen을 발표했습니다. 이는 새로운 3C3H 평가 측정을 기반으로 구축되었으며, LLM-as-judge 접근 방식을 사용하여 모델의 응답을 정확성, 완전성, 간결성, 도움이 됨, 솔직함, 무해함의 관점에서 점수화합니다.
3C3H 측정 개요
3C3H 측정은 사실성과 사용성을 결합한 종합 평가입니다. 여섯 가지 차원을 평가합니다:
- Correctness (binary): ground truth와의 사실적 정확성.
- Completeness (binary): 답변이 질문의 모든 부분을 다루는지 여부.
- Conciseness (1‑5): 필요한 정보를 유지하면서 간결함의 적절성.
- Helpfulness (1‑5): 답변이 사용자를 돕는 정도.
- Honesty (1‑5): 모든 정보의 정확성, 환각에 대한 페널티 부과.
- Harmlessness (1‑5): 공격적이거나 편향된 내용이 없는 정도. 먼저 binary 점수를 계산합니다; correctness 또는 completeness가 zero이면 다른 모든 차원을 zero로 설정합니다. scaled 점수는 [1,5]에서 [0,1]로 정규화됩니다. 전체 3C3H 점수는 샘플당 여섯 차원을 집계하고 데이터셋 전체에서 평균을 냅니다.
AraGen 벤치마크 및 리더보드
AraGen은 3C3H 측정을 사용하여 독점 및 오픈 아랍어 LLM 모두를 순위 매기는 리더보드를 제공합니다. 벤치마크는 질문 answering, 맞춤법 및 문법 분석, 추론, 안전이라는 네 가지 작업을 다루는 279개의 인간 검증 질문으로 구성됩니다.
평가 파이프라인
- 모델 제출 – 사용자는 평가를 위해 모델을 제출합니다.
- 응답 생성 – 모델은 고정된 AraGen 벤치마크 세트에 대한 답변을 생성합니다.
- LLM as Judge – 선택된 LLM은 검증된 ground truth와 각 모델 답변을 비교하여 3C3H 지침을 따르고 JSON 형식으로 점수를 출력합니다.
- 점수 계산 및 정규화 – 먼저 binary 점수를 도출하고, scaled 점수는 [0,1]로 정규화합니다.
- 리더보드 보고 – 결과는 두 개의 리더보드에 표시됩니다: 일반 3C3H 리더보드(전체 및 차원별 점수 표시)와 작업 리더보드(네 가지 작업 각각의 점수 표시).
견고성을 위한 동적 리더보드
데이터 오염을 완화하기 위해 AraGen은 동적 평가 전략을 사용합니다:
- Blind Test Sets – 각 데이터셋은 세 달 평가 기간 동안 비공개로 유지되어 모델 훈련으로의 유출을 방지합니다.
- Periodic Updates – 세 달 후에 blind 세트는 새로운 인간 검증 질문‑답변 쌍 세트로 교체되며, 구조, 복잡성, 도메인 균형을 유지합니다.
- Open‑Sourcing – 비공개 기간이 끝난 후 데이터셋과 평가 코드가 공개적으로 출시되어 독립적인 검증과 재현 가능성을 가능하게 합니다.
데이터셋 설계
AraGen 벤치마크는 네 가지 작업에 걸쳐 분포된 279개의 예시를 포함합니다. 상호작용 유형은 다음과 같습니다:
- Single Interaction – 간단한 질문‑답변.
- Conversational Interaction – 다중 턴 교환; 흐름을 고려하면서 최종 턴에 초점을 맞춥니다.
- Follow‑Up Interaction – 첫 번째 답변에 의존하는 두 번째 답변이 있는 두 턴 시퀀스; 사실적 연속성을 강조하기 위해 첫 번째 답변의 가중치를 두 배로 둡니다. 맞춤법 및 문법 분석의 경우, 데이터는 아랍어 문법과 아랍어 받아쓰기 문법 사이에 균등하게 나뉩니다(각각 50%). 안전 예시는 안전 카테고리에 exclusivamente 속합니다.
심사관 평가 및 선택
저자들은 심사관 후보로 여러 가지 LLM을 실험했으며, 여기에는 GPT‑4o, GPT‑4o‑mini, Claude‑3.5‑sonnet, Claude‑3‑haiku, Llama 3.1‑405b 및 배심원 시스템이 포함됩니다. 평가 기준은 인간 심사관과의 일치도(Cohen’s Kappa), 점수 일관성(표준 편차), 자체 편향, 환각 경향이었습니다.
- Agreement: GPT‑4o‑mini가 인간과의 Kappa가 가장 높았습니다(0.46), 그 뒤를 Claude‑3.5‑sonnet이 바짝 따랐습니다.
- Consistency: 배심원 시스템은 평균 표준 편차가 가장 낮았습니다(0.0049); 단일 심사관 중에서 Claude‑3.5‑sonnet이 가장 안정적이었습니다(0.0063).
- Self‑Bias: Claude‑3.5‑sonnet은 자체 선호 점수가 최소였으며, 반면 GPT‑4o와 GPT‑4o‑mini는 자신의 출력을 다른 심사관보다 높게 점수 매겼습니다.
- Hallucination: Claude‑3.5‑sonnet과 GPT‑4o‑mini 둘 다 지침을 잘 준수했습니다; Claude‑3.5‑sonnet의任何 차이는 API 오류 때문이지 환각이 아닙니다.
결론
AraGen은 3C3H 측정을 통해 사실성과 사용성을 통합하는 아랍어 LLM에 대한 엄격하고 동적인 평가 프레임워크를 도입합니다. 평가 데이터를 세 달 동안 비공개로 유지한 후 공개함으로써 리더보드는 데이터 누출 위험을 줄이면서 투명성과 재현 가능성을 유지합니다. 저자들은 새로운 작업을 추가하여 벤치마크를 확장하고, 데이터셋 생성을 반자동화하며, 이 프레임워크를 다른 자원이 부족한 언어에 적용할 계획입니다.