DiffusionGemma 技术报告
DiffusionGemma 是一种实验性的开源权重语言模型,旨在消除传统自回归 (AR) 模型的顺序解码瓶颈。通过使用离散扩散 (discrete diffusion) 来并行迭代优化每块 256 个 token 的内容,DiffusionGemma 在单个 NVIDIA H100 GPU 上实现了约 1,500 tokens/s 的生成速度,其表现显著优于最先进的投机解码 (speculative decoding) 技术。
架构与训练流水线
DiffusionGemma 并非从零开始训练。相反,它衍生自混合专家 (MoE) 架构的 Gemma 4 模型,该模型具有 3.8B 激活参数和 25.2B 总参数。从仅解码器 (decoder-only) 的 AR 模型到去噪器 (denoiser) 的转换是通过利用所有 token 的 logits 实现的,这是现有 AR 模型具备但通常在标准生成过程中不使用的能力。
训练过程采用了一种计算高效的两阶段流水线,仅需原始 AR 模型总训练 token 预算的不到 10%:
监督微调 (SFT): 第一阶段教授模型双向去噪能力。
强化学习 (RL) 与采样器蒸馏 (Sampler Distillation): 第二阶段将 RL 与采样器蒸馏相结合,以同时提高生成质量和整体推理效率。
性能与能力
DiffusionGemma 在生成速度与模型能力之间的权衡上实现了新的帕累托前沿 (Pareto frontier)。平均而言,它在每次前向传播中生成约 20 个 token,从而在 H100 GPU 上实现相同的 1,500 tokens/s 的吞吐量。
尽管转向了基于扩散的解码方式,该模型仍保留了基础 Gemma 4 模型的核心能力,包括:
- 思维模式 (Thinking mode): 支持内部推理过程。
- 多模态输入: 处理多种输入类型的能力。
- 长上下文 (Longe contexts): 支持扩展的上下文窗口。
此外,该模型仍具备自回归生成的能力,且性能下降极小,这为开发混合扩散-AR 解码系统提供了一条潜在路径。
社区洞察与实现
社区讨论强调了这种方法有望应用于其他开源权重模型,从而为现有的本地 LLM 创建高速扩散版本。
硬件优化
在本地硬件上实现该模型的用户报告称,在 Apple Silicon 上运行成功。一位开发者指出,由于扩散解码是计算密集型而非内存带宽受限型,因此它特别适合于计算能力强但内存带宽有限的设备。
"I've got it up to ~15tok/s on M3-class machines... DiffusionGemma with the right drafter can hit 20-30 tok/s on my machine."
对软件开发的影响
一些分析师认为,如果扩散模型在编程方面达到极高的熟练度,极高的生成速度 (1,500 tokens/sec) 将使软件开发的瓶颈从模型生成转移到 CPU 执行时间。这可能导致人们重新思考编译器、测试套件运行器以及开发栈的设计方式,以便在 LLM 提出建议的同时,并行地进行编译和单元测试。
泛化潜力
社区对于这种方法是否可以应用于其他模型(例如 Qwen)以大幅提升消费级 GPU 用户的本地推理速度表现出了浓厚的兴趣。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- 项目
- Dispatch