FilBench: 필리핀 언어에서 LLM 능력 평가

Hugging Face는 타갈로그어, 필리핀어, 세부아노어에서 LLM의 유창성, 언어 능력 및 문화 지식을 평가하도록 설계된 포괄적인 평가 스위트인 FilBench를 소개했습니다. 이 벤치마크는 필리핀 언어에 대한 LLM 유창성에 대한 일화적 증거를 넘어 모델 성능에 대한 데이터 기반 이해를 구축할 수 있는 체계적인 방법을 제공합니다.

FilBench Framework and Methodology

FilBench는 12개의 작업으로 구성된 네 가지 주요 카테고리로 나뉘는 구조화된 평가 스위트입니다. 벤치마크가 실제 NLP 연구 및 사용 추세를 반영하도록 하기 위해, 이 카테고리들은 2006년부터 2024년 초까지의 필리핀 언어 NLP 연구에 대한 역사적 조사에 기반해 선정되었습니다. 대부분의 카테고리는 언어의 자연스러운 사용을 충실히 반영하기 위해 번역되지 않은 콘텐츠를 활용합니다.

Evaluation Categories

  • Cultural Knowledge: 사실 및 문화적으로 구체적인 정보를 회상하는 능력을 테스트합니다. 여기에는 지역 지식 (Global-MMLU), 필리핀 중심 가치 (KALAHI), 그리고 어휘 의미 구분 (StingrayBench)이 포함됩니다.
  • Classical NLP: 전통적으로 특화된 모델이 처리해 온 정보 추출 및 언어 작업을 다룹니다. 여기에는 명명된 개체 인식 (CebuaNER, TLUnified-NER, Universal NER), 텍스트 분류, 감성 분석 (SIB-200 및 BalitaNLP의 일부 하위 집합)이 포함됩니다.
  • Reading Comprehension: 필리핀어 텍스트의 가독성, 이해도 및 자연어 추론을 평가합니다 (Cebuano Readability Corpus, Belebele, NewsPH NLI).
  • Generation: 번역 충실도에 초점을 맞추며, 영어 → 필리핀어 및 세부아노어 → 영어 번역을 평가합니다. 사용 데이터셋으로는 NTREX-128, Tatoeba, TICO-19 등이 있습니다.

Implementation and Scoring

FilBench는 Lighteval 프레임워크 위에 구축되었습니다. 연구자들은 일반적인 평가 용어에 대한 특정 번역 쌍을 정의했습니다 (예: "yes" → oo, "no" → hindi). 제공된 템플릿을 사용해 맞춤형 작업을 구현했으며, 최종 결과는 FilBench Score 로 표현됩니다. 이는 각 카테고리의 예제 수에 기반한 가중 평균입니다.

Key Findings from LLM Evaluations

20개 이상의 최첨단 LLM을 평가한 결과, 필리핀 언어에서의 성능에 관한 세 가지 주요 통찰이 도출되었습니다.

Region-Specific Models vs. General Models

동남아시아(SEA) 특화 LLM인 SEA-LION 및 SeaLLM은 필리핀 언어에 가장 파라미터 효율적인 모델로, 동일 규모의 다른 모델보다 높은 FilBench 점수를 기록했습니다. 그러나 여전히 GPT-4o와 같은 폐쇄형 모델에 비해 뒤처집니다.

이 격차에도 불구하고, 연구는 SEA 특화 지시‑튜닝 데이터를 사용해 기본 LLM을 지속적으로 미세조정하면 2‑3%의 성능 향상이 가능함을 보여줍니다. 이는 필리핀 및 SEA 특화 학습 데이터의 큐레이션이 모델 개선에 매우 효과적인 방향임을 시사합니다.

Challenges in Generation and Translation

Generation은 평가된 모델들 중 가장 어려운 카테고리였습니다. 번역 작업에서 흔히 나타나는 실패 유형은 다음과 같습니다:

  • 번역 지시를 따르지 못함.
  • 과도하게 장황한 텍스트 생성.
  • 타갈로그어나 세부아노어가 아닌 다른 언어를 환각함.

Cost-Efficiency of Open-Weight Models

Hugging Face에서 제공되는 오픈‑웨이트 LLM은 상업 모델에 비해 큰 성능 손실 없이 비용 효율적인 대안을 제공합니다. 필리핀어 작업에서 GPT-4o를 대체하려는 사용자에게 연구진은 효율성 파레토 프론티어 상에서 강력한 옵션으로 Llama 4 Maverick을 강조했습니다.

Resources and Access

FilBench는 공식 Lighteval 저장소의 커뮤니티 작업 세트로 제공됩니다. 개발자는 arXiv (2508.03523) 를 통해 전체 연구 논문을, GitHub 를 통해 평가 코드를 확인할 수 있습니다.

Sources