构建扩散语言模型:架构、采样与扩展

执行摘要

扩散语言模型 (dLLMs) 代表了从标准的自回归 (AR) 文本生成范式向一种新范式的转变。虽然 AR 模型从左到右顺序生成 token,但扩散模型通过并行生成整个序列,并迭代地将粗略草稿细化为精炼的输出。这种方法解决了 AR 模型的三大核心局限性:缺乏错误纠正能力、顺序生成速度慢以及受限于因果(回顾性)注意力机制。

离散扩散的核心机制

将扩散应用于文本等离散数据需要重新定义“噪声”。与使用高斯噪声的图像扩散不同,语言扩散通常采用掩码 (masking) 或状态替换策略。

掩码扩散模型 (MDLM)

掩码扩散运作方式类似于“生成式 BERT”。该过程包含两个阶段:

  1. 前向过程:根据特定计划,通过将 token 替换为 [MASK] token 来逐渐破坏干净的序列,直到序列被完全掩码。
  2. 反向过程:训练一个双向 Transformer 来从掩码序列中预测原始 token。在生成过程中,模型从一个完全掩码的序列开始,并迭代地填补空白,偶尔会对 token 进行重新掩码以实现细化。

均匀状态扩散 (UDLM)

UDLM 不使用掩码 token,而是从整个词表 (vocabulary) 中随机选择 token 来替换。这确保了中间序列保持无掩码状态,并允许模型在任何步骤修改任何 token,从而促进了更好的错误纠正和可控性。

高级架构与采样

为了从理论模型转向生产级 LLM,需要进行若干架构和算法上的扩展。

分块扩散与可变长度

标准的 MDLM 受限于固定长度序列。分块扩散 (Block Diffusion) 通过根据先前生成的块来生成文本块(例如,256 个 token)解决了这一问题。这种方法支持类似于自回归模型的 KV 缓存,从而实现高效的可变长度生成。

编码器-解码器框架

现代 dLLM,如 Gemma DiffusionNemotron Diffusion,采用了编码器-解码器架构。一个强大的编码器处理一次干净的上下文,而一个轻量级的解码器则迭代地对 token “画布”进行去噪。这种分离减少了去噪步骤的计算成本并加速了训练。

迭代细化与错误纠正

由于标准的掩码机制一旦 token 被取消掩码后就不会再被重新掩码,早期的错误往往是永久性的。目前有两种主要的解决方案:

  • 重新掩码 (Remasking):一种插件式采样器,它随机地对预测的 token 子集进行重新掩码,允许模型在填充更多上下文时纠正语法或逻辑错误。
  • 均匀状态扩散:通过将所有 token 视为潜在的噪声,模型可以自然地修改序列中的任何位置。

通过蒸馏实现采样加速

由于并行生成,扩散模型的速度可以比 AR 模型快 5-10 倍。为了进一步提高速度,使用了渐进式蒸馏 (progressive distillation),即训练一个学生模型来模仿教师模型的两个去噪步骤为一个单一步骤,从而递归地将所需的采样步骤减半。

可控生成与引导

扩散模型在本质上比其他模型更擅长可控生成,因为它们细化的是全局序列,而不是进行局部且不可逆的编辑。这通过样本自然度与属性满足度之间的帕累托权衡 (Pareto trade-off) 来管理。

  • 基于分类器的引导 (CBG):使用一个单独的预测器模型来引导去噪过程趋向于目标属性(例如,分子中的结合亲和力)。
  • 无分类器引导 (CFG):通过随机丢弃条件信号来训练单个模型以处理条件和无条件生成,并结合两种输出以引导结果。

现实世界应用与扩展

生物与科学领域

扩散在生物学领域取得了早期成功,因为生物序列缺乏人类语言的从左到右的偏置,且需要高度的可控性。

  • ESM3:一个拥有 100B 参数的 MDLM,用于蛋白质序列、结构和功能建模。
  • Nucleotide Transformer v3 (NT-v3):一个拥有数十亿参数的模型,用于 DNA 序列生成,利用 CFG 和重新掩码来设计具有特定基因表达水平的调节性 DNA 序列。

通用扩散 LLM

一些前沿实验室已经发布了规模化的扩散模型:

  • LLaDA:一个 8B 参数的开源权重模型,在 GSM8K 和 MMLU 等基准测试中展示了类似于 AR 的扩展能力。
  • Mercury 2:一个商业模型,在标准 GPU 上实现了约 1,200 tokens/second 的速度,显著优于速度优化的 AR 模型(如 Claude Haiku)。
  • Gemma Diffusion:一个 Google 开源权重模型,利用 UDLM 骨干网络和编码器-解码器架构。
  • Nemotron Diffusion:一个 NVIDIA 模型系列(参数量高达 35B),使用联合 AR-扩散目标,提供 2-8 倍于同类 AR 模型的吞吐量。

批判性分析与未来展望

虽然扩散模型在推理速度和硬件利用率方面带来了巨大提升,但仍面临一些技术挑战。社区反馈强调了 token 协调方面的特定弱点:当两个位置都处于两个有效状态之间的摇摆时,扩散模型可能无法将它们合并成匹配的一对,从而导致不一致性。

从扩展性的角度来看,扩散模型对于推理时计算 (inference-time compute) 的意义,可能正如 Transformer 对预训练计算 (pre-training compute) 的意义一样。通过将 AR 推理的顺序瓶颈转化为并行过程,扩散模型允许更高的每秒 FLOPs,从而通过规模化的后训练和推理时搜索来解锁新的智能水平。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • 项目