오픈 아라비아 LLM 리더보드 소개

Hugging Face와 Technology Innovation Institute (TII)는 아라비아 대형 언어 모델(LLM)의 성능을 평가하고 비교하도록 설계된 전문 플랫폼인 Open Arabic LLM Leaderboard (OALL)를 출시했습니다. 이 이니셔티브는 평가 도구가 역사적으로 영어에 편향되어 있던 자연어 처리(NLP) 분야의 자원 격차를 해소하고, 3억 8천만 명이 넘는 아라비아어 사용자를 위한 모델 개선을 위한 표준화된 방법을 제공합니다.

포괄적인 벤치마크 데이터셋

OALL는 다양한 언어 작업 전반에 걸친 모델 능력을 포괄적으로 평가하기 위해 견고한 데이터셋을 다양하게 활용합니다:

  • AlGhafa Benchmark: TII LLM 팀이 개발한 이 벤치마크는 독해, 감정 분석, 질문 응답을 평가합니다. 11개의 원어 아라비아어 데이터셋과 널리 채택된 영어 NLP 벤치마크의 번역본 11개로 구성됩니다.
  • ACVA and AceGPT Benchmarks: 여기에는 "AceGPT, Localizing Large Language Models in Arabic" 논문에서 나온 58개의 데이터셋과 MMLU 및 EXAMS 벤치마크의 번역본이 포함되어, 언어 복잡성과 미묘함을 폭넓게 다룹니다.

평가 지표 및 기술 인프라

리더보드는 주요 지표로 normalized log likelihood accuracy를 사용합니다. 이 선택은 벤치마크 데이터셋에서 사용되는 객관식 및 예/아니오 질문 형식에 특화되어 있어, 다양한 작업 유형에 걸친 성능을 공정하게 측정합니다.

기술적으로 OALL는 다음 스택을 사용하여 구축되었습니다:

  • Framework: 평가를 실행하기 위해 lighteval 라이브러리를 사용합니다. 팀은 PR #44와 PR #95를 통해 아라비아어 벤치마크를 lighteval에 통합하여 커뮤니티가 바로 평가를 수행할 수 있도록 했습니다.
  • Architecture: 프론트엔드와 백엔드는 demo-leaderboard에서 영감을 받았으며, 백엔드는 TII 클러스터에 로컬로 호스팅됩니다.

모델 제출 가이드라인

리더보드의 무결성을 유지하기 위해 참가자는 모델 제출 시 다음 기술 요구사항을 따라야 합니다:

  • Precision Alignment: 모델 정밀도는 원본 모델과 일치해야 하며, 이를 통해 올바른 표시와 평가가 보장됩니다.
  • Compatibility: 모델은 AutoClasses(AutoConfig, AutoModel, AutoTokenizer)를 통해 로드 가능해야 하며, 공개 가시성으로 설정되어야 합니다.
  • Weight Format: 가중치는 safetensors로 변환되어야 하며, 이를 통해 더 빠른 로딩과 Extended Viewer에서 파라미터 수를 표시할 수 있습니다.
  • Licensing: 접근성을 높이기 위해 공개 라이선스 모델만 허용됩니다.
  • Documentation: 완전한 모델 카드를 제공해야 하며, 이 데이터는 리더보드 표시를 위해 자동으로 추출됩니다.

향후 로드맵 및 커뮤니티 목표

OALL 팀은 다음과 같은 여러 향후 이니셔티브를 통해 플랫폼 범위를 확대할 계획입니다:

  • Specialized Leaderboards: 검색 강화 생성(RAG) 시나리오를 위한 리더보드와 사용자 선호도 기반 ELO 점수를 활용한 챗봇 아레나 등 새로운 카테고리를 개발합니다.
  • OpenDolphin Benchmark: "Dolphin: A Challenging and Diverse Benchmark for Arabic NLG" 논문의 공개 복제본을 만들며, 약 50개의 데이터셋을 포함할 예정입니다.
  • Cross-Language Application: 이 프로젝트는 전 세계 NLP 자원 격차를 해소하기 위해 다른 소외된 언어들을 위한 대규모 언어별 리더보드를 만드는 청사진이 되는 것을 목표로 합니다.

Sources