pengzhangzhi/Open-dLLM

Open diffusion language model for code generation — releasing pretraining, evaluation, inference, and checkpoints.

What it solves

Open-dLLM は、拡散ベースの大規模言語モデル(dLLM)を作成するための完全オープンソーススタックを提供します。従来のリリースは重みや推論スクリプトのみを提供することが多かったのに対し、本プロジェクトは事前学習コード、データセット、評価スイート、チェックポイントを含む全パイプラインを公開し、研究者が完全に再現可能でアクセスしやすい環境を実現します。

How it works

本プロジェクトは Masked Diffusion Model(MDM)目的関数を使用し、マスク率を一様にサンプリングし、クロスエントロピー損失で再構成します。自回帰言語モデル(例:Qwen2.5-Coder)を継続的な事前学習により拡散言語モデルへ適応させることをサポートします。さらに「representation alignment」技術を実装しており、自回帰モデルと拡散モデルの表現を揃えることで、適応速度を 4 倍に高速化できます。

Who it’s for

拡散ベースの言語モデリングに関心のある AI 研究者や開発者、特に生データから学習済みチェックポイントと評価までのフルサイクルを完結させたい方に向けています。

Highlights

  • Full-Stack Open Source: 事前学習パイプライン、オープンデータセット(FineCode)、推論スクリプトを含む。
  • Representation Alignment: 自回帰 LM を拡散 LM に適応させる速度を向上させる専門機能。
  • Comprehensive Evaluation: 標準的なコード生成(HumanEval、MBPP)およびコードインフィリングタスク用の組み込み評価スイート。
  • Ready-to-use Weights: Hugging Face 上で Open-dCoder(0.5B)などのチェックポイントを提供。