히브리어 LLM을 위한 Hugging Face 오픈 리더보드
Hugging Face는 히브리어 대형 언어 모델(LLM)을 위한 오픈 리더보드를 도입하여, 일반 LLM 벤치마크에서 충분히 다루어지지 않는 언어에 대한 표준화된 평가 프레임워크를 제공하고자 합니다. 이 이니셔티브는 히브리어의 특수한 형태학적 복잡성을 해결함으로써 언어적·문화적으로 정확한 모델 개발을 촉진하는 것을 목표로 합니다.
히브리어 언어적 과제 해결
히브리어는 어근과 패턴의 복잡한 시스템으로 특징지어지는 형태학적으로 풍부한 언어이며, 접두사·접미사·중간 삽입어가 의미, 시제, 복수형을 변형합니다. 전통적인 토크나이징 전략은 형태학적으로 더 단순한 언어를 위해 설계된 경우가 많아 히브리어에 대해서는 효과가 떨어지는 경우가 빈번합니다. 이로 인해 기존 LLM이 언어의 미묘한 차이를 처리하는 데 어려움을 겪을 수 있으며, 이러한 고유한 언어적 특성을 반영한 전용 벤치마크가 필요합니다.
평가 지표 및 벤치마크
리더보드는 히브리어 이해와 생성 능력을 테스트하기 위해 네 가지 핵심 데이터셋을 활용합니다. 이 벤치마크는 제한된 컨텍스트에서도 모델이 적응하고 올바르게 응답할 수 있도록 few‑shot 프롬프트 형식을 사용합니다.
Hebrew Question Answering
이 작업은 모델이 히브리어 구문과 의미를 이해하고 제공된 컨텍스트를 기반으로 정확한 답변을 찾아내는 능력을 평가합니다. HeQ 데이터셋의 테스트 서브셋을 사용합니다.
Sentiment Accuracy
이 벤치마크는 모델이 언어적 단서를 기반으로 히브리어 문장을 긍정, 부정, 중립으로 분류하는 능력을 평가합니다. Hebrew Sentiment 데이터셋을 사용합니다.
Winograd Schema Challenge
이 작업은 모델이 대명사를 해석하고 논리적 추론 및 일반 세계 지식을 활용해 컨텍스트 모호성을 해결하는 능력을 측정합니다. Dr. Vered Schwartz가 제공한 히브리어 번역 Winograd Schema Challenge 를 사용합니다.
Translation
이 벤치마크는 영어와 히브리어 간 번역 능력을 평가하며, 언어적 정확성, 유창성 및 의미 보존에 중점을 둡니다. NeuLabs-TedTalks 정렬 번역 코퍼스를 활용합니다.
기술 구현
리더보드는 Demo Leaderboard template 을 사용해 구축되었으며 Open LLM Leaderboard에서 영감을 받았습니다. 기술 파이프라인은 다음과 같이 작동합니다:
- Deployment: 제출된 모델은 Hugging Face Inference Endpoints 를 통해 자동으로 배포됩니다.
- Evaluation: 모델은 lighteval 라이브러리로 관리되는 API 요청을 통해 평가됩니다.
후원 및 협업
이 프로젝트는 DDR&D IMOD / The Israeli National Program for NLP in Hebrew and Arabic 의 후원을 받으며, DICTA: The Israel Center for Text Analysis 와 Webiks 와 협업합니다. Bar‑Ilan University의 Prof. Reut Tsarfaty가 과학적 자문과 지도를 제공했습니다.