BenCzechMark: 체코어 LLM을 위한 포괄적인 평가 스위트
Hugging Face는 BUT FIT, FI MUNI, CIIRC CTU와 협력하여 BenCzechMark를 발표했습니다. 이는 체코어 대형 언어 모델(LLM)의 능력을 평가하기 위해 설계된 최초의 포괄적인 평가 스위트입니다. 이 벤치마크는 추론, 문법 정확성, 체코 문화에 대한 사실 지식, 언어 모델링 확률을 측정하기 위한 표준화된 프레임워크를 제공합니다.
벤치마크 구성 및 작업 카테고리
BenCzechMark는 50 tasks와 9 categories에 걸쳐 구성되어 있으며, 콘텐츠의 90%는 원어 체코어이고 10%는 (주로 CUBBITT와 DeepL을 통해) 번역되었습니다. 이 스위트는 다음과 같은 차원에서 모델을 평가합니다:
- Reading Comprehension: Belebele (Accuracy)와 SQAD3.2 (Exact Match)를 사용하여 컨텍스트에서 정보 추출을 테스트합니다.
- Factual Knowledge: Umimeto (Accuracy), TriviaQA (Exact Match), NaturalQuestions (Exact Match)를 통해 저장된 지식을 테스트합니다.
- Czech Language Understanding: CERMAT (EM/AUROC/Acc), Grammar Error Detection (AUC), Agree (Accuracy)를 활용해 구문 및 뉘앙스를 중점적으로 평가합니다.
- Language Modeling: Czech National Corpus (Perplexity)와 HellaSwag (Accuracy)를 통해 텍스트 샘플링 가능성을 측정합니다.
- Math Reasoning in Czech: Klokan QA (Accuracy), CERMAT (Exact Match/Accuracy), Umimeto Math (Accuracy)를 사용해 문제 해결 능력을 평가합니다.
- Natural Language Inference: Czech SNLI (AUROC), CSFever (AUROC), CTKFacts (AUROC), Propaganda (AUROC)를 통해 함의와 지원을 테스트합니다.
- Named Entity Recognition (NER): CNEC2.0 (Exact Match)와 Court Decisions (Exact Match)를 이용해 엔터티 유형을 식별합니다.
- Sentiment Analysis: Subjectivity (AUROC)와 CzechSentiment (AUROC)를 통해 감정을 정량화합니다.
- Document Retrieval: Historical IR (Accuracy)를 사용해 관련 구절을 식별합니다.
평가 지표
다양한 작업 유형을 다루기 위해 벤치마크는 네 가지 주요 지표를 사용합니다:
- Accuracy (Acc): 다지선다형 작업에 사용됩니다.
- Exact Match (EM): 짧은 답변 생성 작업에 사용됩니다.
- Area Under the Receiver Operating Characteristic Curve (AUROC): 분류 작업에 사용되어 임계값 보정이 필요 없으며 모델 간 공정한 비교를 보장합니다.
- Word-level Perplexity (Ppl): 언어 모델링 작업에 사용되며 코퍼스당 단어 기준으로 정규화됩니다.
새로운 듀얼 점수 메커니즘
벤치마크는 여러 지표와 서로 다른 스케일을 사용하기 때문에 단순 평균이 불가능합니다. BenCzechMark는 최종 순위를 결정하기 위해 **Duel Win Score (DWS)**를 도입했습니다.
각 작업마다 모델은 α=0.05 수준의 통계적 유의성 검정을 통해 비교됩니다. 사용되는 검정은 ACC와 EM에 대한 단측 짝지은 t‑test, AUROC에 대한 베이지안 검정, Ppl에 대한 부트스트래핑을 포함합니다. 모델의 DWS는 특정 작업에서 다른 모든 모델과의 "듀얼" 중 승리한 비율을 의미합니다. 최종 종합 점수는 카테고리 DWS들의 평균으로 계산되는 Macro-averaged model win-rate입니다.
모델 성능 및 리더보드 결과
3‑shot 예시, 2048 토큰 입력 길이, 로그‑확률 집계를 위한 평균 풀링을 사용한 26개의 오픈‑웨이트 모델 평가 결과는 다음과 같은 주요 인사이트를 보여줍니다:
- Llama-405B가 리더보드 전체에서 가장 높은 성능을 기록했습니다.
- Qwen-72B는 수학 및 정보 검색 분야에서 뛰어난 성능을 보였지만 다른 카테고리에서는 뒤처졌습니다.
- Aya-23-35B는 감정 분석과 언어 모델링에서 우수한 결과를 보였습니다.
- Gemma-2 9B는 체코어 독해에서 훨씬 큰 모델들을 크게 앞섰습니다.
연구자와 개발자는 전용 Hugging Face Space를 통해 자신의 모델을 BenCzechMark 리더보드에 제출하여 체코어 중심 LLM 개발을 촉진할 수 있습니다.