mmBERT: ModernBERT가 다국어로 확장

Hugging Face는 1,800개 이상의 언어에서 3조 토큰 이상으로 학습된 최첨단 대규모 다국어 인코더 모델 mmBERT를 발표했습니다. mmBERT는 XLM‑R을 능가하는 최초의 모델로, 자연어 이해(NLU)와 검색 성능 모두에서 큰 향상을 제공하면서 추론 속도가 2‑4배 빠릅니다.

학습 데이터 및 단계적 언어 포함

mmBERT는 3조 토큰 이상의 정제된 데이터셋으로 학습되었으며, 저자원 언어 데이터의 영향을 과도한 반복 없이 극대화하기 위해 단계적 언어 포함 전략을 사용했습니다. 데이터 출처에는 고품질 영어 콘텐츠를 위한 DCLM 및 Filtered DCLM, 1,800개 이상의 언어를 포괄하는 FineWeb2, 20개 고자원 언어를 위한 FineWeb2‑HQ가 포함됩니다. 또한 모델은 Dolma, MegaWika v2, ProLong에서 제공하는 코드, 학술 콘텐츠, 위키피디아, 교과서 등 특수 코퍼스를 통합합니다.

학습 데이터를 세 단계에 걸쳐 anneal 하였습니다:

  • Pre-training: 60개의 고자원 언어에 초점.
  • Mid-training: 110개 언어로 확대.
  • Decay phase: 전체 1,833개 언어 포함.

학습 레시피 및 아키텍처 혁신

mmBERT는 ModernBERT 아키텍처를 기반으로 하며, Flash Attention 2와 unpadding 기법을 활용해 높은 처리량을 달성합니다. 다국어 텍스트 처리를 개선하기 위해 Gemma 2 토크나이저를 채택했으며, 최대 8,192 토큰까지 지원합니다.

모델 변형

  • mmBERT-base: 비임베딩 파라미터 110M (전체 307M).
  • mmBERT-small: 비임베딩 파라미터 42M (전체 140M).

새로운 학습 기법

  • Inverse Mask Ratio Schedule: 마스킹 비율을 30% → 15% → 5% 로 점진적으로 낮추어 기본 표현 학습에서 미세한 이해 단계로 전환.
  • Annealed Language Learning: 데이터 샘플링 온도를 $\tau=0.7 \to 0.5 \to 0.3$ 로 조정해 고자원 언어에서 보다 균등한 샘플링으로 편향을 이동.
  • Model Merging: TIES 병합을 사용해 감소 단계에서 학습된 세 가지 변형(영어 중심, 110언어, 전체 언어)을 최종 모델에 결합.

성능 벤치마크

자연어 이해 (NLU)

mmBERT-base는 영어 GLUE 벤치마크에서 XLM‑R base와 mGTE base를 크게 앞서며, 다국어 XTREME 벤치마크에서는 XNLI 분류와 TyDiQA 질문 응답에서 현저한 개선을 보입니다. 다만 토크나이저 차이로 NER 및 POS 태깅 같은 구조적 예측 작업에서는 이전 세대와 비슷한 성능을 나타냅니다.

검색 및 코드 성능

MTEB v2 영어 벤치마크에서 mmBERT는 ModernBERT와 같은 영어 전용 모델의 성능에 버금됩니다. 다국어 MTEB v2 벤치마크에서는 기존 모델 대비 일관된 향상을 보이며, CoIR 코드 벤치마크에서는 EuroBERT를 제외한 대부분의 모델보다 뛰어난 코딩 성능을 입증합니다.

감소 단계에서 저자원 언어 습득

mmBERT는 짧은 감소 단계 동안 저자원 언어를 효과적으로 학습할 수 있음을 보여줍니다. 최종 100B 토큰 단계에서 1,700개 이상의 언어를 도입함으로써 기존의 다국어 기반을 활용해 빠른 학습을 달성했습니다.

Tigrinya(TiQuaD)와 Faroese(FoQA) 테스트에서 mmBERT는 Google Gemini 2.5 Pro와 OpenAI o3 같은 훨씬 큰 모델들을 크게 앞서며, 특히 Faroese 질문 응답 작업에서 뛰어난 성능을 보였습니다. 이는 모델이 처음부터 학습하기보다 기존 교차언어 표현을 빠르게 적응할 수 있음을 시사합니다.

효율성 및 프로덕션 준비도

mmBERT는 이전 다국어 인코더 대비 2‑4배 높은 처리량을 제공합니다. 이러한 향상은 ModernBERT 아키텍처 유산, 특히 다음 요소들 덕분입니다:

  • Flash Attention 2: 메모리 사용량 감소를 위한 최적화된 어텐션 연산.
  • Unpadding: 불필요한 패딩 토큰 제거.
  • Extended Context: 최대 8,192 토큰까지 효율적으로 처리해 대규모 긴 문서 처리 가능.

Sources