pengzhangzhi/Open-dLLM
Open diffusion language model for code generation — releasing pretraining, evaluation, inference, and checkpoints.
What it solves
Open-dLLM 提供了一个完全开源的堆栈,用于创建基于扩散的大型语言模型(dLLM)。以往的发布往往只提供权重和推理脚本,而该项目开放了整个管道——包括预训练代码、数据集、评估套件和检查点——以确保研究人员能够完整复现和使用。
How it works
项目使用 Masked Diffusion Model(MDM)目标,遮蔽比例均匀采样,并使用交叉熵损失进行重建。它支持通过持续预训练将自回归语言模型(如 Qwen2.5-Coder)转化为扩散语言模型。此外,还实现了“representation alignment”技术,通过对齐自回归模型和扩散模型的表示,可将适配速度提升 4 倍。
Who it’s for
对扩散式语言建模感兴趣的 AI 研究者和开发者,尤其是想要完成从原始数据到训练检查点和评估完整循环的人。
Highlights
- Full-Stack Open Source: 包含预训练管线、开放数据集(FineCode)和推理脚本。
- Representation Alignment: 一项专门用于加速自回归模型向扩散模型适配的功能。
- Comprehensive Evaluation: 内置标准代码生成(HumanEval、MBPP)和代码填充任务的评估套件。
- Ready-to-use Weights: 在 Hugging Face 上提供检查点,例如 Open-dCoder(0.5B)。