아라비아 리더보드: 아라비아 지시 따르기 및 AraGen 업데이트

Hugging Face와 Inception은 Mohammed bin Zayed University of Artificial Intelligence (MBZUAI)와 협력하여 Arabic-Leaderboards Space를 출시했습니다. 이 통합 플랫폼은 아라비아 AI 평가를 중앙화하고, 아라비아 지시 따르기에 대한 최초의 공개 벤치마크를 도입하며 AraGen 생성 리더보드를 업데이트하여 아라비아 LLM 평가의 엄격성을 향상시킵니다.

아라비아-리더보드 공간

Arabic-Leaderboards Space는 다양한 모달리티에 걸친 아라비아 AI 평가를 위한 중앙 허브 역할을 합니다. 현재 플랫폼은 두 개의 주요 실시간 리더보드를 호스팅하고 있습니다: AraGen-03-25Arabic Instruction Following. 개발자들은 연구가 진행됨에 따라 추가 리더보드와 과제를 포함하도록 이 공간을 확장할 계획입니다.

AraGen-03-25 릴리스 및 평가

AraGen은 생성 작업에 대한 LLM을 벤치마킹하기 위해 설계된 아라비아 생성 리더보드입니다. 최신 릴리스인 AraGen-03-25는 평가 프레임워크에 여러 주요 업데이트를 도입합니다.

데이터셋 확장 및 분포

AraGen-03-25 데이터셋은 이전 버전의 279개에서 340개의 질문-답변 쌍으로 확장되었습니다. 작업 분포는 다음과 같습니다:

  • 질문 답변: 약 200쌍
  • 추론: 70쌍
  • 안전 질문: 40쌍
  • 철자 및 문법 분석: 30쌍

동적 평가 및 순위 안정성

신뢰성을 보장하기 위해 Inception은 데이터셋을 공개하기 전 3개월 동안 비공개(블라인드 테스트)로 유지하는 동적 평가 사이클을 활용합니다. AraGen-12-24 benchmark가 이제 공개되었으며, 3C3H 가이드라인을 사용해 Claude-3.5-Sonnet이 평가한 모델 응답을 포함합니다.

이전 시스템 프롬프트(SP1)와 현재 시스템 프롬프트(SP2) 간의 순위 변동 분석 결과, 순위는 전반적으로 안정적임을 보여줍니다. 모델 o1-2024-12-17은 지속적으로 1위를 유지하지만, 절대 점수가 82.67% (AraGen-12-24)에서 70.25% (AraGen-03-25)로 감소했으며, 이는 업데이트된 벤치마크가 훨씬 더 어려워졌음을 나타냅니다.

3C3H 평가 측정

3C3H 메트릭은 사실성 및 사용성을 기반으로 모델의 채팅 능력을 평가합니다. 최근 분석에서 주요 발견은 정확성, 유용성, 무해성 간의 높은 상관관계이며, 간결성은 예외로 남아 있습니다. 대부분의 모델은 장황함에 대해 보상을 받지만, 분석에 따르면 silma-ai/SILMA-9B-Instruct-v1.0이 더 큰 오픈-웨이트 모델보다 간결성이 높았으나, 기본 모델인 google/gemma-2-9b-it에 비해 유용성은 감소했습니다.

아라비아 지시 따르기 (Arabic IFEval)

지시 따르기는 LLM이 특정하고 객관적으로 측정 가능한 제약을 준수하는 능력입니다. Inception은 아라비아 언어를 위한 최초의 공개 벤치마크인 Arabic IFEval을 도입했습니다.

데이터셋 구성

Google의 English IFEval에서 영감을 받아, Arabic IFEval 데이터셋은 약 300개의 프롬프트로 구성됩니다. 단순 번역이 아니라, 팀은 프롬프트를 아라비아 언어의 뉘앙스와 문화적 맥락을 반영하도록 조정했습니다. 주요 특징은 다음과 같습니다:

  • 언어적 도전: 아라비아 음성학, 철자법 및 형태론에 초점을 맞춘 프롬프트(예: 모음 부호/tashkīl 사용).
  • 제약 유형: 특정 문자(예: Alef) 회피, 특정 단어 빈도 사용, 혹은 엄격한 길이 및 구두점 제약을 따르는 검증 가능한 명령.
  • 전문가 검증: 모든 프롬프트는 문법적 정확성과 명확성을 보장하기 위해 아라비아 언어학자에 의해 검증되었습니다.

평가 방법론

평가는 재현성을 보장하고 AI-판사 편향을 제거하기 위해 자동화된 Python 스크립트를 통해 수행됩니다. 벤치마크는 두 가지 정확도 수준을 사용합니다:

  • 프롬프트 수준 엄격 정확도: 프롬프트 내 모든 지시가 모두 따랐을 때만 성공으로 표시되는 엄격한 메트릭.
  • 지시 수준 점수: 부분적인 준수를 평가하는 보다 관대한 메트릭.

성능 결과

아라비아와 영어 IFEval에서 프롬프트 수준 정확도를 비교한 예비 결과는 모델이 일반적으로 영어에서 더 좋은 성능을 보임을 나타냅니다. 예를 들어, claude-3.5-sonnet은 아라비아 순위에서 72.5% 정확도로 1위를 차지했으며, 영어에서는 84.7%였습니다. 아라비아에서 다른 상위 모델로는 gpt-4o-2024-08-06(70.8%)와 gpt-4o-mini-2024-07-18(68.1%)이 있습니다.

향후 로드맵

Inception과 MBZUAI는 Arabic-Leaderboards Space를 지속적으로 업데이트할 계획입니다. 앞으로 추가될 항목에는 camel-benchkitab이 지원하는 시각적 질문-답변(VQA) 리더보드가 포함됩니다.


SUMMARY: Hugging Face와 Inception은 최초의 공개 아라비아 지시 따르기(Arabic IFEval) 벤치마크와 업데이트된 AraGen-03-25 생성 리더보드를 특징으로 하는 Arabic-Leaderboards Space의 출시를 발표했습니다.

TITLE: 아라비아 리더보드: 아라비아 지시 따르기 및 AraGen 업데이트

Sources