ML-GSAI/LLaDA

Official PyTorch implementation for "Large Language Diffusion Models"

解决的问题

LLaDA 解决了这样一个假设,即高级大语言模型 (LLM) 能力(如上下文学习和指令遵循)仅与自回归(预测下一个 token)架构绑定。它探索了掩码扩散模型在大规模语言生成方面的极限。

工作原理

与预测序列中下一个 token 的标准 LLM 不同,LLaDA 是一个掩码扩散模型。它使用 Transformer 架构,但采用了一种概率建模方法,即学习从掩码序列中恢复原始 token。在训练期间,它使用一个在 0 到 1 之间随机变化的掩码率,这使其训练目标成为模型分布的负对数似然的上界,从而将其转变为一个生成模型。在推理过程中,它通过重掩码 (remasking) 过程迭代地优化序列。

适用对象

对替代 LLM 架构感兴趣的研究人员和开发人员,特别是那些正在探索将基于扩散的语言建模作为自回归模型替代方案的人。

亮点

  • 规模:一个从头开始训练的 8B 参数模型,在性能上可以媲美 LLaMA3 8B。
  • 架构灵活性:使用标准的 Transformer 架构,不需要将时间 $t$ 作为输入。
  • MoE 变体:包括 LLaDA-MoE,这是第一个使用混合专家 (Mixture-of-Experts) 架构从头开始预训练的扩散语言模型。
  • 多模态扩展:LLaDA-V 将基于扩散的方法扩展到了视觉-语言建模。
  • 效率提升:iLLaDA 版本同时提高了基准测试性能和生成效率。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch