QIMMA: 품질 우선 아라비아어 LLM 리더보드

QIMMA: 품질 우선 아라비아어 LLM 리더보드

QIMMA는 모델을 평가하기 전에 벤치마크를 검증하여 보고된 점수가 실제 아라비아어 능력을 반영하도록 하는 새로운 아라비아어 대형 언어 모델(LLM) 리더보드입니다. 기존 아라비아어 NLP 평가에서 흔히 나타나는 파편화와 품질 문제를 해결하기 위해 모델 테스트 전에 데이터셋에 다단계 검증 파이프라인을 적용합니다.

아라비아어 NLP 평가의 파편화 해결

아라비아어 NLP 평가는 역사적으로 파편화되고 품질 문제에 시달려 왔습니다. QIMMA는 현재 상황에서 네 가지 주요 문제점을 식별합니다:

  • 번역 인공물: 많은 벤치마크가 영어에서 번역되어 분포 변화와 문화적으로 맞지 않는 질문을 초래합니다.
  • 검증 부족: 원어민 아라비아어 벤치마크는 종종 엄격한 품질 검사가 부족하여 주석 일관성 부족 및 잘못된 정답을 초래합니다.
  • 재현성 격차: 공개 평가 스크립트와 샘플별 출력이 부족해 결과 감사를 어렵게 합니다.
  • 커버리지 격차: 기존 리더보드는 종종 좁은 도메인이나 개별 작업에만 초점을 맞춥니다.

QIMMA는 오픈 소스이며, 99% 원어민 아라비아어 콘텐츠를 활용하고, 코드 평가를 포함한 체계적인 품질 검증을 구현하며, 공개 샘플별 추론 출력을 제공함으로써 차별화됩니다.

QIMMA 데이터셋 및 도메인 커버리지

QIMMA는 14개의 소스 벤치마크에서 109개의 하위 집합을 통합하여 52,000개 이상의 샘플로 구성된 통합 스위트를 만들었습니다. 평가는 일곱 개의 구별된 도메인과 세 가지 작업 유형에 걸쳐 진행됩니다:

도메인 벤치마크 작업 유형
문화 AraDiCE-Culture, ArabCulture, PalmX MCQ
STEM ArabicMMLU, GAT, 3LM STEM MCQ
법률 ArabLegalQA, MizanQA MCQ, QA
의료 MedArabiQ, MedAraBench MCQ, QA
안전 AraTrust MCQ
시와 문학 FannOrFlop QA
코딩 3LM HumanEval+, 3LM MBPP+ Code

특히, QIMMA는 HumanEval+와 MBPP+의 아라비아어 적응 버전을 통해 코드 평가를 통합한 최초의 아라비아어 리더보드이며, 아라비아어 문제 진술을 사용해 코딩 역량을 평가할 수 있습니다.

품질 검증 파이프라인

QIMMA는 모델 평가가 이루어지기 전에 벤치마크를 정제하기 위해 다단계 검증 파이프라인을 사용합니다.

단계 1: 다모델 자동 평가

두 개의 최첨단 LLM—Qwen3-235B-A22B-Instruct와 DeepSeek-V3-671B—가 각각 10점 척도로 각 샘플을 독립적으로 평가합니다. 어느 한 모델이 7점 이하로 점수를 매기면 해당 샘플은 제외됩니다. 하나의 모델만 샘플을 표시하면 인간 검토 단계로 진행됩니다.

단계 2: 인간 주석 및 검토

문화 및 방언에 익숙한 원어민 아라비아어 화자들이 표시된 샘플을 검토합니다. 이 주석자들은 방언적 뉘앙스, 문화적 맥락, 주관적 해석에 대한 최종 결정을 내려 정답이 정확하고 문화적으로 민감하도록 합니다.

아라비아어 벤치마크의 체계적 품질 문제

검증 파이프라인은 품질 문제가 고립된 것이 아니라 체계적임을 밝혀냈습니다. 벤치마크별 폐기율은 다르게 나타났으며, ArabicMMLU가 3.1%(436개 샘플)로 가장 높은 폐기율을 보였고 MizanQA는 2.3%(41개 샘플)였습니다.

문제는 네 가지 유형의 분류 체계로 구분되었습니다:

  1. 답변 품질: 사실과 다른 답변 또는 잘못된 정답 인덱스.
  2. 텍스트 및 형식 품질: 맞춤법/문법 오류, 손상된 텍스트, 중복 샘플.
  3. 문화적 민감성: 일괄적인 일반화 또는 고정관념 강화.
  4. 정답 일치성: 정답과 평가 프로토콜 간 불일치.

코드 벤치마크 정제

코드 벤치마크는 단순히 폐기할 수 없기 때문에 팀은 3LM이 HumanEval+와 MBPP+에 적용한 아라비아어 문제 진술을 정제했습니다. 그 결과 3LM HumanEval+ 프롬프트의 88%와 3LM MBPP+ 프롬프트의 81%가 언어 정제, 명확성 및 구조적 수정으로 변경되었습니다.

평가 프레임워크 및 메트릭

QIMMA는 재현성을 보장하기 위해 LightEval, EvalPlus, 그리고 FannOrFlop을 평가 프레임워크로 활용합니다. 메트릭은 작업 유형에 따라 할당됩니다:

  • MCQ: 정규화된 로그 가능도 정확도.
  • 다중 선택 MCQ: 정답 선택에 대한 확률 질량.
  • 생성형 QA: F1 BERTScore (AraBERT v02 사용).
  • 코드: Pass@1.

프롬프트는 MCQ, MCQ-C, MCQ-I, QA, QA-C, QA-F의 여섯 가지 템플릿 유형으로 표준화되며, 모두 아라비아어로 작성됩니다.

리더보드 결과 및 인사이트

2026년 4월 현재, 최고 성능 모델은 다음과 같습니다:

  • 전체 리더: Qwen/Qwen3.5-397B-A17B-FP8 (평균 점수 68.06).
  • 문화 및 언어 전문가: Jais-2-70B-Chat이 ArabicMMLU와 ArabCulture에서 선두를 차지합니다.
  • 도메인 전문가: Karnak이 3LM STEM과 ArabLegalQA에서 선두를 차지합니다.
  • 코딩 성능: 다국어 모델, 특히 Qwen3.5-397B가 코딩 작업에서 계속해서 선두를 유지합니다.

결과에서 도출된 주요 발견은 모델 규모가 모든 도메인에서 최고의 성능을 보장하지 않으며, 아라비아어 특화 모델이 규모가 비슷한 다국어 모델보다 문화 및 언어 작업에서 자주 우수하다는 점입니다.

Sources