dllm-reasoning/d1
Official Implementation for the paper "d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning"
해결하는 문제
사전 훈련된 확산형 대규모 언어 모델(dLLMs)에서 복잡한 추론 작업을 확장하는 문제를 해결합니다. 일반적으로 표준 자기회귀 모델에 비해 dLLMs는 복잡한 추론 작업에서 어려움을 겪습니다.
작동 방식
이 프로젝트는 두 단계 접근 방식을 구현합니다:
- 마스크된 SFT: 모델 초기화를 위해 완성 전용 마스크된 감독 미세조정(SFT)을 사용합니다.
- diffu-GRPO: 마스크된 dLLMs에 특화된 새로운 정책 그래디언트 방법으로, 그룹 상대 정책 최적화(GRPO) 기반입니다. 이 방법은 효율적인 로그 확률 추정을 특징으로 하여 추론 확장용 강화학습(RL)을 가능하게 합니다.
대상 사용자
확산 기반 언어 모델 개발 및 연구에 종사하는 연구자 및 개발자, 그리고 비자기회귀형 LLM의 추론 성능을 강화학습으로 향상시키고자 하는 사람.
주요 특징
- 새로운 강화학습 방법: 확산형 LLM에서 효율적인 정책 그래디언트 업데이트를 위한 diffu-GRPO 도입.
- 이중 단계 파이프라인: 마스크된 SFT와 RL을 결합하여 추론 능력 확장.
- 완전한 도구 세트: SFT, RL 훈련, 평가 스크립트의 구현 제공.
- 통합성: 훈련 및 데이터 수집에 Transformers 유사 인터페이스를 따릅니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트