Hugging Face와 LLM-jp, 오픈 일본어 LLM 리더보드 출시
Hugging Face와 LLM-jp 연구 컨소시엄은 일본어 대형 언어 모델(LLM)의 성능을 평가하기 위한 중앙 집중식이고 투명한 시스템을 제공하기 위해 Open Japanese LLM Leaderboard를 출시했습니다. 이 이니셔티브는 복잡한 문자 체계와 단어 경계가 없는 등 고유한 언어적 도전을 가진 언어에 대한 공개 벤치마크 표준이 부족한 문제를 해결합니다.
포괄적 평가 스위트
Open Japanese LLM Leaderboard는 llm-jp-eval 라이브러리를 활용해 16개의 서로 다른 작업에 걸쳐 모델을 평가합니다. 작업은 4-shot 프롬프트 방식으로 수행됩니다. 평가 스위트에는 언어학자와 전문가가 처음부터 만든 데이터셋과, 일본 문화·언어적 특수성을 반영해 자동 번역된 데이터셋이 포함됩니다.
주요 평가 데이터셋
- Jamp: 자연어 추론(NLI)을 위한 시계열 추론 벤치마크로, 함의, 중립, 모순을 테스트합니다.
- JEMHopQA: 내부 추론 및 도출 생성 능력을 평가하기 위해 설계된 다중 홉 질문응답 데이터셋입니다.
- jcommonsenseqa: 일반 상식 추론을 평가하기 위한 CommonsenseQA의 일본어 버전입니다.
- chABSA: 일본 상장 기업의 2016 회계연도 재무 보고서를 기반으로 한 측면 기반 감성 분석 데이터셋으로, 금융청(FSA) 분류 체계를 따릅니다.
- mbpp-ja: Mostly Basic Python Problems(MBPP) 데이터셋을 DeepL을 통해 번역한 프로그래밍 데이터셋입니다.
- mawps: 기본 산술 및 방정식에 대한 단계별 Chain-of-Thought(CoT) 추론을 강조한 수학 평가 데이터셋으로, 일본 상황에 맞게 조정되었습니다.
- JMMLU: MMLU의 일부를 기반으로 하며, 일본의 시민, 지리, 관용구 등에 맞게 조정된 지식 데이터셋입니다.
- XL-Sum: BBC 뉴스 기사에 대한 일본어 번역을 활용한 추상적 요약 데이터셋입니다.
기술 구현
리더보드의 아키텍처는 Open LLM Leaderboard에서 영감을 받았습니다. 기술 스택은 다음과 같습니다:
- Deployment: Hugging Face Inference Endpoints를 통한 자동 배포.
- Evaluation Framework:
llm-jp-eval라이브러리 (버전 1.14.1). - Inference Engine: 메모리 효율적인 서빙을 위한 vLLM (버전 v0.6.3).
- Compute Backend: 일본의 mdx 프리미엄 연구 컴퓨터 플랫폼.
성능 관찰
리더보드 분석을 통해 일본 LLM 생태계에서 몇 가지 추세가 드러났습니다:
- Architecture Preferences: Meta의 Llama 아키텍처가 일본 AI 연구소에서 널리 선호되지만, Mistral 및 Qwen 아키텍처도 상위 점수를 기록했습니다.
- Open vs. Closed Source: 오픈소스 아키텍처가 폐쇄형 모델과의 격차를 좁혀가고 있습니다. 예를 들어, LLM-jp가 개발한
llm-jp-3-13b-instruct모델은 폐쇄형 대안과 비슷한 성능을 보입니다. - Remaining Challenges: 대부분의 LLM은 금융(
chABSA), 언어 주석(Wikipedia Annotated Corpus), 코드 생성(mbpp-ja), 요약(XL-Sum) 등 도메인 특화 작업에서 여전히 어려움을 겪고 있습니다. - Cultural Alignment: 일본 기업이나 연구소에서 개발한 모델이
JCommonsenseMorality데이터셋에서 더 높은 점수를 받으며, 이는 일본 가치에 맞는 윤리적 선택을 평가합니다.
향후 로드맵
평가 프레임워크는 llm-jp-eval 도구와 함께 진화할 예정입니다. 계획된 개선 사항은 다음과 같습니다:
- Expanded Datasets:
JHumanEval(HumanEval의 일본어 버전) 및MMLU통합. - Advanced Evaluation: 기본 프롬프트와 비교하기 위한 Chain-of-Thought(CoT) 평가 구현.
- New Metrics: 모델이 제공된 라벨 외의 토큰을 예측하는 빈도를 측정하는 "Out-of-Choice rate"를 도입해 지시 따르기 능력의 프록시로 활용합니다.