T5Gemma: 通过 Decoder-Only 适配实现 Encoder-Decoder LLMs

Google DeepMind 推出了 T5Gemma,这是一系列全新的编码器-解码器(encoder-decoder)大语言模型(LLMs),通过将预训练的 decoder-only 模型转换为 encoder-decoder 架构而创建。这种方法使模型能够利用 encoder-decoder 设计的优势——例如更高的推理效率和更丰富的输入表示——同时利用预训练 decoder-only 模型中已经捕获的知识。

模型适配:将 Decoder-Only 转换为 Encoder-Decoder

T5Gemma 是使用一种称为模型适配(model adaptation)的技术开发的。该方法不是从头开始训练 encoder-decoder 模型,而是使用预训练 decoder-only 模型的权重来初始化新模型的参数。然后,通过使用基于 UL2 或 PrefixLM 的目标进行预训练,对这些参数进行进一步适配。

这种适配方法实现了灵活的架构配置,包括“非平衡”模型。例如,一个 9B 的 encoder 可以与一个 2B 的 decoder 配对(T5Gemma 9B-2B)。这种灵活性允许开发人员针对摘要生成等任务优化质量与效率之间的权衡,在这些任务中,理解输入(encoder)比生成输出(decoder)的复杂度更为关键。

质量与推理效率

T5Gemma 模型与对应的 decoder-only Gemma 模型相比,展示了更优越的质量-推理效率帕累托前沿(Pareto frontier)。这意味着在给定的推理计算水平下,它们能提供更好的性能。

关键性能观察结果包括:

  • 延迟与准确度: 在 GSM8K(数学推理)基准测试中,T5Gemma 9B-9B 在保持相似延迟的同时,实现了比 Gemma 2 9B 更高的准确度。
  • 效率提升: T5Gemma 9B-2B 模型在保持与体积小得多的 Gemma 2 2B 模型几乎相同的延迟的同时,比 2B-2B 模型提供了显著的准确度提升。
  • 表示质量: T5Gemma 模型在多个基准测试中几乎统治了质量-推理效率前沿,包括衡量学习表示质量的 SuperGLUE。

推理与指令微调能力

T5Gemma 在其预训练状态和指令微调(instruction-tuned)状态下,在推理和通用能力方面都表现出显著的提升。

预训练性能

通过适配进行的预训练带来了复杂推理任务的增益。与原始的 Gemma 2 9B 模型相比,T5Gemma 9B-9B 的得分:

  • 在 GSM8K(数学推理)上高出 9 分以上。
  • 在 DROP(阅读理解)上高出 4 分。

指令微调 (IT) 性能

在指令微调之后,T5Gemma 与 decoder-only 模型之间的性能差距进一步扩大。例如,T5Gemma 2B-2B IT 显示:

  • MMLU 得分比 Gemma 2 2B 提高了近 12 分。
  • GSM8K 得分从 58.0% 提高到 70.7%。

可用的 T5Gemma 检查点

Google DeepMind 已通过 Hugging Face、Kaggle 和 Vertex AI 向社区发布了一系列 T5Gemma 检查点(checkpoints)。发布的模型包括:

  • 多种尺寸: T5 尺寸模型(Small、Base、Large 和 XL)、基于 Gemma 2 的模型(2B 和 9B),以及一个位于 T5 Large 和 T5 XL 之间的模型。
  • 多种变体: 提供预训练版本和指令微调版本。
  • 灵活配置: 提供了一个非平衡的 9B-2B 检查点,用于探索 encoder-decoder 的尺寸权衡。
  • 训练目标: 提供使用 PrefixLM 或 UL2 目标训练的模型,以支持最先进的生成性能或表示质量。

Sources