mmBERT:ModernBERT 走向多语言
Hugging Face 已宣布 mmBERT,这是一款最先进的超大规模多语言编码器模型,使用超过 3 万亿 token,覆盖 1,800 多种语言。mmBERT 是首个在 XLM‑R 基础上实现显著提升的模型,在自然语言理解(NLU)和检索性能上都有显著增益,同时提供 2‑4 倍更快的推理速度。
训练数据与渐进式语言纳入
mmBERT 在一个精心策划的 3 万亿以上 token 数据集上进行训练,采用渐进式语言纳入策略,以在不产生过度重复的情况下最大化低资源语言数据的影响。数据来源包括用于高质量英文内容的 DCLM 和 Filtered DCLM,覆盖广泛多语言的 FineWeb2(1,800 多种语言),以及针对 20 种高资源语言的 FineWeb2‑HQ。此外,模型还整合了来自 Dolma、MegaWika v2 和 ProLong 的专门语料库,涵盖代码、学术内容、维基百科和教材。
为优化学习,训练数据在三个阶段进行退火:
- 预训练:聚焦 60 种高资源语言。
- 中期训练:扩展至 110 种语言。
- 衰减阶段:包含全部 1,833 种语言。
训练配方与架构创新
mmBERT 基于 ModernBERT 架构,使用 Flash Attention 2 和去填充技术以实现高吞吐量。它采用 Gemma 2 分词器以更好地处理多语言文本,并支持最长 8,192 token 的序列长度。
模型变体
- mmBERT‑base:110M 非嵌入参数(总计 307M)。
- mmBERT‑small:42M 非嵌入参数(总计 140M)。
新颖训练技术
- 逆掩码比例调度:在三个训练阶段中,掩码率逐步从 30% 降至 15%,最终降至 5%,以实现从基础表征学习到细致理解的转变。
- 退火语言学习:数据抽样温度从 $\tau=0.7 \to 0.5 \to 0.3$ 调整,使偏向高资源语言的倾向转向更均匀的抽样。
- 模型合并:使用 TIES 合并将衰减阶段训练的三种不同变体(以英语为中心、110 语言以及全语言)合并为最终模型。
性能基准
自然语言理解(NLU)
mmBERT‑base 在英文 GLUE 基准上显著超越 XLM‑R base 和 mGTE base。在多语言 XTREME 基准上,它在 XNLI 分类和 TyDiQA 问答方面表现出显著提升,尽管由于分词器差异,在 NER 与词性标注等结构化预测任务上与前代模型表现相近。
检索与代码性能
在 MTEB v2 英文基准中,mmBERT 与仅英文模型(如 ModernBERT)的能力持平。在多语言 MTEB v2 基准中,它相较现有模型持续提升。此外,mmBERT 在 CoIR 代码基准上表现出强劲的编码性能,超越除 EuroBERT 外的大多数模型。
衰减阶段的低资源语言获取
mmBERT 证明低资源语言可以在短暂的衰减阶段有效学习。通过在最终的 1000 亿 token 阶段引入超过 1,700 种语言,模型利用已有的多语言基础实现了快速学习。
在 Tigrinya(TiQuaD)和 Faroese(FoQA)测试中,mmBERT 超越了包括 Google Gemini 2.5 Pro 与 OpenAI o3 在内的体积更大的模型,尤其在 Faroese 问答任务上表现突出。这表明模型能够快速适配已有的跨语言表征,而非从零开始学习。
效率与生产就绪度
mmBERT 相较于之前的多语言编码器提供了 2‑4 倍的吞吐量提升。这些提升归功于 ModernBERT 的架构传统,具体包括:
- Flash Attention 2:优化的注意力计算,降低内存使用。
- 去填充:消除不必要的填充 token。
- 扩展上下文:高效处理最多 8,192 token,使大规模处理更长文档成为可能。