Ettin Suite:SoTA 配对编码器和解码器
Hugging Face 已宣布推出 Ettin Suite,这是首个集合了最先进(SoTA)配对的仅编码器和仅解码器模型,参数规模从 17M 到 1B。通过使用相同的训练数据(2T 令牌)、模型结构和训练配方,Ettin 能够在双向编码器架构和因果解码器架构之间进行受控的“苹果对苹果”比较。
架构比较:编码器 vs. 解码器
Ettin 表明,无论训练配方如何,基本的架构差异仍然存在。主要区别在于注意力模式:编码器模型使用双向注意力(所有令牌均可见),而解码器模型使用因果注意力(令牌只能看到之前的令牌)。
关键发现包括:
- 分类与检索:编码器模型在这些任务上占优势。例如,150M 编码器在 MNLI 分类上优于 400M 解码器(89.2 对 88.2)。
- 文本生成:解码器模型在生成任务中始终保持优势,且随着模型规模增大,这一差距会扩大。
- 规模 vs. 架构:对于特定任务,架构往往比规模更重要;400M 编码器可以在分类任务上击败 1B 解码器,而 400M 解码器在生成任务上则胜过 1B 编码器。
Ettin 模型基于 ModernBERT 的现代化配方开发,对两种架构都应用了最新的仅解码器技术。所有用于 Ettin 的训练数据都是公开且可复现的。
三阶段训练过程
- 预训练(1.7T 令牌):在较短上下文(1024 令牌)上进行初始训练,使用多样化的高质量数据混合。
- 上下文扩展(250B 令牌):将上下文长度提升至 8K 令牌,使用过滤后的更高质量数据,以提升对长文档的理解。
- 衰减(100B 令牌):最终训练阶段使用优质来源,包括教材和科学论文,并采用逐渐降低的学习率。
模型规模
Ettin 提供六种配对规模,以测试规模效应:- 17M、32M、68M、150M、400M 和 1B 参数。
性能基准
编码器结果
Ettin 编码器模型在所有测试任务和模型规模上均优于 ModernBERT,同时使用完全公开的训练数据。这为设备端(小规模)和高性能(1B 规模)应用提供了一系列高性能编码器。
解码器结果
Ettin 解码器模型在已建立的基准(如 Llama 3.2 和 SmolLM2)上持平或超越。性能提升在知识密集型任务(如 SciQ)中尤为显著,这归功于高质量的训练数据混合。
研究洞察与模型行为
跨目标训练
Ettin 被用于测试模型是否可以从一种架构的目标转换到另一种(例如,用掩码语言模型继续对解码器进行预训练)。结果表明,架构选择是根本性的:
- 从解码器到编码器:在分类和检索任务上通常落后于原生编码器。
- 从编码器到解码器:表现显著逊于原生解码器,尤其在更大规模时更为明显。
行为分析
使用 WinoGender 基准,研究人员发现训练目标会影响模型偏见。编码器模型更倾向于使用性别中性的代词(超过 60%),而解码器则约为 30%+,尽管两种架构都表现出男性偏向。
实现与使用
Ettin 模型可通过 Hugging Face Hub 获取。推荐在分类和检索任务中使用编码器,而在文本生成任务中使用解码器。
编码器示例
from transformers import AutoTokenizer, AutoModel
tokenizer = AutoTokenizer.from_pretrained("jhu-clsp/ettin-encoder-150m")
model = AutoModel.from_pretrained("jhu-clsp/ettin-encoder-150m")
解码器示例
from transformers import AutoTokenizer, AutoModelForCausalLM
tokenizer = AutoTokenizer.from_pretrained("jhu-clsp/ettin-decoder-150m")
model = AutoModelForCausalLM.from_pretrained("jhu-clsp/ettin-decoder-150m")