pengzhangzhi/Open-dLLM
Open diffusion language model for code generation — releasing pretraining, evaluation, inference, and checkpoints.
What it solves
Open-dLLM 은 확산 기반 대형 언어 모델(dLLM)을 만들기 위한 완전 오픈소스 스택을 제공합니다. 이전 릴리스는 주로 가중치와 추론 스크립트만 제공했지만, 이 프로젝트는 사전 학습 코드, 데이터셋, 평가 스위트, 체크포인트 등 전체 파이프라인을 공개하여 연구자들이 완전한 재현성과 접근성을 확보할 수 있게 합니다.
How it works
프로젝트는 Masked Diffusion Model(MDM) 목표를 사용하며, 마스킹 비율을 균등하게 샘플링하고 교차 엔트로피 손실로 복원합니다. Qwen2.5-Coder와 같은 자동 회귀 LM을 지속적인 사전 학습을 통해 확산 LM으로 전환하는 것을 지원합니다. 또한 "representation alignment" 기술을 구현하여 자동 회귀 모델과 확산 모델의 표현을 정렬함으로써 모델 적응 속도를 4배 가속화합니다.
Who it’s for
확산 기반 언어 모델링에 관심이 있는 AI 연구자 및 개발자, 특히 원시 데이터부터 학습된 체크포인트와 평가까지 전체 사이클을 완성하고자 하는 분들을 위한 프로젝트입니다.
Highlights
- Full-Stack Open Source: 사전 학습 파이프라인, 오픈 데이터셋(FineCode), 추론 스크립트를 포함합니다.
- Representation Alignment: 자동 회귀 LM을 확산 LM으로 적응시키는 속도를 높이는 특화 기능.
- Comprehensive Evaluation: 표준 코드 생성(HumanEval, MBPP) 및 코드 인필링 작업을 위한 내장 평가 스위트.
- Ready-to-use Weights: Hugging Face 에서 Open-dCoder(0.5B) 등 체크포인트를 제공합니다.