The Open Arabic LLM Leaderboard 2

Overview

Hugging Face와 파트너들은 아랍어를 지원하는 대규모 언어 모델(LLM)에 대해 더욱 정확하고 투명한 평가를 제공하기 위해 설계된 개선된 벤치마킹 플랫폼인 Open Arabic LLM Leaderboard 2 (OALL v2)를 출시했습니다. 이번 업데이트는 언어의 복잡한 형태론, 구문 및 문화적 뉘앙스를 더 잘 포착하기 위해 기계 번역된 작업에서 네이티브 아랍어 벤치마크로 초점을 전환했습니다.

아랍어 벤치마킹의 한계 해결

이전의 아랍어 LLM 리더보드는 사용자가 직접적인 비교 대신 모델 제작자의 문서에 의존해야 하는 리소스 제한 문제와 제출된 결과에 대한 중앙 집중식 검증 부족으로 인한 무결성 문제로 어려움을 겪는 경우가 많았습니다.

OALL v2는 리더보드의 첫 번째 버전 및 기타 커뮤니티 이니셔티브에서 식별된 단점들을 구체적으로 해결합니다:

  • 번역 편향 감소: v1의 많은 작업은 영어에서 직접 번역된 것이었으며, 이는 언어적 불일치를 초래하고 실제 아랍어 사용 사례를 반영하지 못했습니다.
  • 벤치마크 포화: 여러 v1 벤치마크는 모델이 거의 완벽한 점수를 달성함에 따라 효과가 떨어졌으며, 이로 인해 점진적인 개선을 구별하는 것이 불가능해졌습니다.
  • 기술적 수정: AlGhafa 작업의 버그가 수정되었습니다. 이전에는 시스템이 인덱스가 아닌 선택 텍스트를 기준으로 응답을 평가하여, 규모가 작거나 성능이 낮은 모델에 최대 20점까지 불균형적인 불이익을 주었습니다.

OALL v2의 신규 및 유지 벤치마크

OALL v2는 두 가지 지침 원칙을 따릅니다: 포화된 작업 및 기계 번역된 작업의 제거와 고품질 네이티브 또는 인간이 큐레이션한 벤치마크의 추가입니다.

유지된 데이터셋

기존 OALL에서 리더보드는 AlGhafa 벤치마크(Facts-Balanced, SOCAL, XGLUE, Sentiment 및 Sentiment-Rating의 인간 큐레이션 버전 포함), Belebele(Arabic-MSA 및 Arabic-Dialects), 그리고 Arabic EXAMS 벤치마크의 네이티브 아랍어 데이터셋을 유지합니다.

신규 데이터셋

  • Native Arabic MMLU: 학교 시험에서 가져온 현대 표준 아랍어(MSA)로 된 약 15,000개의 객관식 질문을 포함하는 40개 작업.
  • Human Translated MMLU (MMLU-HT): JAIS 프로젝트의 일환으로 Inception이 큐레이션한 기존 영어 MMLU의 57개 작업 인간 번역본.
  • MedinaQA: 일반적인 아랍어 언어 및 문법 측면에 초점을 맞춘 데이터셋.
  • AraTrust: 안전성과 진실성을 평가하는 522개의 인간 작성 객관식 질문.

ALRAGE 벤치마크

OALL v2는 아랍어에서의 RAG 능력을 평가하기 위한 프레임워크인 **ALRAGE (Arabic Language Retrieval Augmented Generation Evaluation)**를 도입합니다.

  • 데이터셋: 다양한 주제의 아랍어 서적 40권에서 가져왔으며, 합성 생성을 위해 Meta-Llama-3.1-70B를 사용하고 Argilla와의 커뮤니티 스프린트를 통해 네이티브 화자가 검증했습니다.
  • 방법론: lighteval 프레임워크를 통해 "LLM-as-judge" 메트릭을 활용합니다. Qwen2.5-72B-Instruct가 심사위원 역할을 수행하며, 정확성, 관련성 및 품질을 기준으로 0-10점 척도로 응답을 채점한 후 0-1 범위로 정규화합니다.

성능 분석 및 결과

OALL v1과 v2 사이의 통계적 비교에 따르면 AraTrust, ALRAGE 및 업데이트된 AlGhafa와 같은 새로운 벤치마크에서의 성능은 다양한 모델 크기에 걸쳐 더 분산되어 있는 반면, ACVA 및 Toxigen과 같은 오래된 작업은 상당한 포화 상태를 보였습니다.

모델 순위

  • 최상위 성능 모델: Llama-3.3-70B-Instruct가 OALL v2의 모든 카테고리에서 선두를 차지했습니다.
  • 사전 학습 모델: Qwen 모델은 계속해서 강력한 베이스라인 역할을 하고 있습니다; 구체적으로 Qwen/Qwen2-72B가 최상위 사전 학습/지속 사전 학습 모델로서 Qwen/Qwen2.5-72B를 능가합니다.
  • 리더보드 간 상관관계: OALL v2와 AraGen 및 SEAL Arabic과 같은 다른 리더보드 사이에 주목할 만한 상관관계가 있으며, Llama-3.3-70B-Instruct는 OALL v2와 AraGen 모두에서 1위를 차지했습니다.

모델 제품군 트렌드

AceGPT 및 Jais 제품군을 분석한 결과, 일반적으로 모델 규모가 클수록 더 높은 평균 점수를 달성하는 것으로 나타났습니다. 그러나 주목할 만한 예외로 inceptionai/jais-family-30b-8k 모델은 OALL v2에서 더 큰 inceptionai/jais-adapted-70b 모델을 능가합니다.

운영 변경 사항

계산 리소스에 대한 공정한 접근을 보장하고 참여 조직 간의 다양성을 장려하기 위해, OALL v2는 이제 조직당 주당 5개의 모델로 제출을 제한합니다. 또한, 리더보드는 이제 채팅 템플릿을 지원합니다. 모델 구성에서 템플릿이 발견되면 평가에 사용됩니다.

Sources