3LM: 아랍어 LLM을 위한 STEM 및 코드 벤치마크

3LM (علم)은 STEM(과학, 기술, 공학, 수학) 과목 및 코드 생성을 대상으로 아랍어 대형 언어 모델(LLM)을 평가하도록 설계된 다중 구성 요소 벤치마크입니다. 이는 이전 평가가 감성 분석 및 요약과 같은 일반 목적 작업에 주로 초점을 맞추고 구조화된 추론 및 형식 논리보다는 아랍어 NLP에서 중요한 격차를 해결합니다.

벤치마크 구성 요소

3LM은 기술 분야에서 모델 역량을 포괄적으로 파악하기 위해 서로 다른 평가 축을 목표로 하는 세 가지 별도 데이터셋으로 구성됩니다.

1. 네이티브 STEM

네이티브 STEM은 교과서, 워크시트, 8학년부터 12학년까지의 시험 은행 등 실제 아랍어 교육 자료에서 추출한 865개의 객관식 질문(MCQ)으로 구성됩니다. 데이터셋은 물리학, 화학, 생물학, 수학, 지리의 다섯 핵심 과목을 다룹니다. 각 질문에는 분야와 난이도(1–10 등급) 메타데이터가 포함됩니다. 생성 파이프라인은 OCR, Pix2Tex를 통한 LaTeX 수식 파싱, LLM 지원 추출 및 수동 검토를 활용했습니다.

2. 합성 STEM

고난이도 추론을 테스트하고 답변 편향을 줄이기 위해 합성 STEM 구성 요소는 YourBench 파이프라인을 사용해 만든 1,744개의 MCQ를 포함합니다. 이 과정은 아랍어 교과서 텍스트를 청크화하고 요약한 뒤 이를 LLM 기반 질문 생성 시스템의 입력으로 활용합니다. 생성된 질문은 중·고난도 개념적, 분석적, 적용 기반 문제에 초점을 맞추며 수동 검토를 통해 검증되었습니다.

3. 아랍어 코드 벤치마크

3LM은 HumanEval+와 MBPP+ 벤치마크를 번역 및 적용하여 자연어 프로그래밍 프롬프트에 대한 아랍어 LLM 테스트용 최초의 코드 데이터셋을 도입합니다. 프롬프트 번역에는 GPT-4o를 사용했으며, 역번역 파이프라인(ROUGE-L F1 < 0.8인 샘플은 거부)과 인간 필터링을 통해 품질을 보장했습니다. 점수 정확성을 유지하기 위해 원본 코드와 테스트 스위트는 변경되지 않으며, 평가에는 pass@1 및 pass@1+ 메트릭을 위한 EvalPlus 프레임워크를 사용합니다.

주요 평가 결과

40개 이상의 LLM을 평가한 결과, 다양한 작업 형식 및 모델에 따라 강점이 다르게 나타났습니다.

  • Multiple-Choice Questions: Qwen2.5-72B-Instruct가 가장 높은 성능을 기록했으며, 네이티브 STEM에서 71.8%, 합성 STEM에서 67.0%를 달성했습니다.
  • Generative Completion: Gemma-3-27B는 STEM 답변에서 43.2% 정확도로 가장 강력한 결과를 보여주었습니다.
  • Code Generation: GPT-4o는 HumanEval-ar에서 83.5% pass@1+, MBPP-ar에서 63.6% pass@1+로 벤치마크를 선도했습니다.

분석 결과, 아랍어와 영어 pass@1 점수 간에 높은 상관관계(~0.97)가 나타났으며, 이는 언어별 프롬프트의 품질이 모델 결과에 크게 영향을 미친다는 것을 의미합니다. 또한, 지시 튜닝된 모델은 방해 요소 교란에 노출될 때 기본 모델보다 훨씬 더 안정적인 것으로 확인되었습니다.

구현 및 도구

3LM은 재현성을 위해 설계되었으며 표준 평가 도구와 통합됩니다:

  • lighteval: STEM 데이터셋에 대한 객관식 및 주관식 질문 평가 모두에 사용됩니다.
  • evalplus: 함수 수준 테스트를 통해 견고한 pass@1 및 pass@1+ 코드 점수 산출에 사용됩니다.

모든 평가 스크립트, 구성 및 파이프라인은 GitHub에 공개되어 있으며, OpenAI API 또는 HuggingFace Transformers와 호환되는 모든 모델을 지원합니다.

데이터셋 접근

모든 3LM 데이터셋은 오픈소스로 HuggingFace Datasets에서 제공됩니다:

  • 3LM-native-stem
  • 3LM-synthetic-stem
  • 3LM-code-arabic

Sources