apple-aiml-research/ml-diffucoder

DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation

解决的问题

DiffuCoder解决了自回归(AR)模型在代码生成中的局限性,具体探索了掩码扩散模型(dLLM)如何更灵活、更高效地生成代码。它还通过引入新的采样方案,确保所有token都能获得学习信号,解决了dLLM后训练中的低效率和高方差问题。

工作原理

DiffuCoder是一个用于代码生成的掩码扩散模型。与从左到右生成文本的AR模型不同,它使用扩散过程来精炼token。为了提高性能,该项目引入了Coupled-GRPO,这是一种使用耦合采样方案的后训练方法。该方案选择成对的时间步,共同覆盖所有目标token,确保每个token的对数概率至少被计算一次,并在现实的部分掩码上下文中提供更准确的概率估计。

适用人群

该项目面向从事非自回归生成、基于扩散的语言模型和专用代码生成模型的AI研究人员和开发者。

亮点

  • Coupled-GRPO:一种新颖的后训练方法,用于减少扩散LLM中的方差并提高学习效率。
  • 非线性生成:打破传统AR模型严格的从左到右偏差的能力。
  • 自回归分数:一种量化生成过程中因果模式的新指标。
  • 预训练模型:在Hugging Face上提供7B模型的Base、Instruct和cpGRPO版本。

相关

  • 项目
  • 项目
  • 项目
  • 项目