apple-aiml-research/ml-diffucoder
DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation
解决的问题
DiffuCoder解决了自回归(AR)模型在代码生成中的局限性,具体探索了掩码扩散模型(dLLM)如何更灵活、更高效地生成代码。它还通过引入新的采样方案,确保所有token都能获得学习信号,解决了dLLM后训练中的低效率和高方差问题。
工作原理
DiffuCoder是一个用于代码生成的掩码扩散模型。与从左到右生成文本的AR模型不同,它使用扩散过程来精炼token。为了提高性能,该项目引入了Coupled-GRPO,这是一种使用耦合采样方案的后训练方法。该方案选择成对的时间步,共同覆盖所有目标token,确保每个token的对数概率至少被计算一次,并在现实的部分掩码上下文中提供更准确的概率估计。
适用人群
该项目面向从事非自回归生成、基于扩散的语言模型和专用代码生成模型的AI研究人员和开发者。
亮点
- Coupled-GRPO:一种新颖的后训练方法,用于减少扩散LLM中的方差并提高学习效率。
- 非线性生成:打破传统AR模型严格的从左到右偏差的能力。
- 自回归分数:一种量化生成过程中因果模式的新指标。
- 预训练模型:在Hugging Face上提供7B模型的Base、Instruct和cpGRPO版本。
相关
- 项目
- 项目
- 项目
- 项目