mmBERT:ModernBERT 走向多語言化
Hugging Face 宣佈了 mmBERT,這是一個最先進的超大規模多語言編碼模型,訓練使用了超過 3 兆 token,涵蓋超過 1,800 種語言。mmBERT 是首個在 XLM‑R 基礎上取得改進的此類模型,在自然語言理解(NLU)與檢索效能上皆有顯著提升,同時提供 2‑4 倍更快的推論速度。
訓練資料與漸進式語言納入
mmBERT 使用了精選的 3 兆以上 token 資料集進行訓練,採用漸進式語言納入策略,以在不過度重複的情況下最大化低資源語言資料的影響。資料來源包括 DCLM 與 Filtered DCLM(提供高品質的英文內容)、FineWeb2(涵蓋廣泛的多語言,超過 1,800 種語言)以及 FineWeb2‑HQ(針對 20 種高資源語言)。此外,模型亦整合了來自 Dolma、MegaWika v2 與 ProLong 的專門語料庫,涵蓋程式碼、學術內容、Wikipedia 與教科書。
為了最佳化學習,訓練資料在三個階段中逐步調整:
- Pre-training:聚焦於 60 種高資源語言。
- Mid-training:擴展至 110 種語言。
- Decay phase:納入全部 1,833 種語言。
訓練配方與架構創新
mmBERT 基於 ModernBERT 架構構建,使用 Flash Attention 2 與去填充(unpadding)技術以達到高吞吐量。它採用 Gemma 2 tokenizer 以更好地處理多語言文本,並支援長度最高達 8,192 token 的序列。
模型變體
- mmBERT-base:110M 非嵌入參數(307M 總計)。
- mmBERT-small:42M 非嵌入參數(140M 總計)。
新穎訓練技術
- Inverse Mask Ratio Schedule:遮蔽率在三個訓練階段中逐步從 30% 降至 15%,最終降至 5%,以從基礎表徵學習過渡到細緻的理解。
- Annealed Language Learning:資料抽樣溫度從 $\tau=0.7 \to 0.5 \to 0.3$ 調整,將偏向高資源語言的偏差轉移為更均勻的抽樣。
- Model Merging:使用 TIES 合併將在衰減階段訓練的三種不同變體(以英語為主、110 語言、全部語言)結合為最終模型。
效能基準
自然語言理解(NLU)
mmBERT-base 在英語 GLUE 基準上顯著優於 XLM‑R base 與 mGTE base。於多語言 XTREME 基準測試中,它在 XNLI 分類與 TyDiQA 問答上展現顯著提升,然而因 tokenizer 差異,在 NER 與 POS 標註等結構化預測任務上表現與前代相似。
檢索與程式碼效能
在 MTEB v2 英語基準測試中,mmBERT 與僅支援英語的模型(如 ModernBERT)表現相當。於多語言 MTEB v2 基準測試中,它持續超越現有模型。此外,mmBERT 在 CoIR 程式碼基準上展現強勁的程式碼效能,僅次於 EuroBERT,超過大多數模型。
衰減階段的低資源語言學習
mmBERT 證明低資源語言可在短暫的衰減階段中有效學習。透過在最後的 100B token 階段引入超過 1,700 種語言,模型藉由既有的多語言基礎快速獲得學習效果。
在 Tigrinya(TiQuaD)與 Faroese(FoQA)測試中,mmBERT 超越了規模遠大於它的模型,包括 Google Gemini 2.5 Pro 與 OpenAI o3 在 Faroese 問答任務上的表現。此結果顯示模型能快速調整既有的跨語言表徵,而非從頭學習。
效率與生產就緒度
mmBERT 在吞吐量上較先前的多語言編碼器提升了 2‑4 倍。此提升歸功於 ModernBERT 的架構傳承,具體包括:
- Flash Attention 2:優化的注意力計算以降低記憶體使用。
- Unpadding:消除不必要的填充 token。
- Extended Context:有效處理最多 8,192 token,使大規模處理更長文件成為可能。