pengzhangzhi/Open-dLLM

Open diffusion language model for code generation — releasing pretraining, evaluation, inference, and checkpoints.

What it solves

Open-dLLM 提供了一個完全開源的堆疊,用於建立基於擴散的大型語言模型(dLLM)。過去的發佈通常只提供權重與推理腳本,而此專案則開放整個管線——包括預訓練程式碼、資料集、評估套件與檢查點——以確保研究人員能完整復現與使用。

How it works

此專案使用 Masked Diffusion Model(MDM)目標,將遮蔽比例均勻抽樣,並以交叉熵損失進行重建。它支援將自回歸語言模型(如 Qwen2.5-Coder)透過持續預訓練轉換為擴散語言模型。此外,還實作了「representation alignment」技術,透過對齊自回歸模型與擴散模型的表示,可將適配速度提升 4 倍。

Who it’s for

對擴散式語言建模有興趣的 AI 研究者與開發者,特別是想要從原始資料到訓練檢查點與評估完整循環的人。

Highlights

  • Full-Stack Open Source: 包含預訓練管線、開放資料集(FineCode)與推理腳本。
  • Representation Alignment: 一項專門用於加速自回歸模型向擴散模型適配的功能。
  • Comprehensive Evaluation: 內建標準程式碼生成(HumanEval、MBPP)與程式碼填補任務的評估套件。
  • Ready-to-use Weights: 在 Hugging Face 上提供檢查點,例如 Open-dCoder(0.5B)。