inclusionAI/LLaDA2.X
LLaDA2.0 is the diffusion language model series developed by InclusionAI team, Ant Group.
解决的问题
LLaDA2.X 是一系列离散扩散大语言模型 (dLLMs),旨在将基于扩散的文本生成扩展到 1000 亿参数级别,克服了传统自回归模型在推理速度和架构方面的局限性。
工作原理
该项目实现了用于语言建模的离散扩散过程。它利用混合专家 (MoE) 架构来扩展模型规模(在 LLaDA2.0-flash 变体中高达 100B 参数)。为了提高效率,它采用了并行解码机制以及基于 dInfer 和 SGLang 的定制推理引擎,支持 KV-Cache 复用和块级并行解码。
适用对象
需要能够大规模处理复杂指令遵循和代码生成任务的高性能文本生成模型的研究人员和开发人员,特别是那些正在寻找标准自回归 LLM 替代方案的人。
亮点
- 100B 参数规模:首个达到 1000 亿参数规模的扩散语言模型。
- 推理加速:使用置信度感知并行 (CAP) 解码实现高达 535 tokens/s 的速度。
- MoE 架构:使用混合专家架构在扩展规模的同时保持性能。
- 开源:在 Hugging Face 上提供完全开源的模型权重和训练代码。
相关
- 项目
- 项目
- 项目
- Dispatch
- 项目