ML-GSAI/LLaDA

Official PyTorch implementation for "Large Language Diffusion Models"

해결하는 문제

LLaDA는 인컨텍스트 학습(in-context learning) 및 지시 이행(instruction-following)과 같은 고차원적인 대규모 언어 모델(LLM) 능력이 오직 자기회귀(다음 토큰 예측) 아키텍처에만 종속되어 있다는 가정에 도전합니다. 또한 대규모 언어 생성에 있어 마스크 확산 모델의 한계를 탐구합니다.

작동 원리

시퀀스의 다음 토큰을 예측하는 표준 LLM과 달리, LLaDA는 마스크 확산 모델입니다. Transformer 아키텍처를 사용하지만, 마스크된 시퀀스에서 원래의 토큰을 복구하는 법을 배우는 확률적 모델링 방식을 채택합니다. 학습 과정에서 0과 1 사이에서 무작위로 변하는 마스킹 비율을 사용하여 학습 목적 함수를 모델 분포의 음의 로그 가능도(negative log-likelihood)의 상한선으로 만들며, 이를 통해 생성 모델로 변모시킵니다. 추론 시에는 재마스킹(remasking) 과정을 통해 시퀀스를 반복적으로 정교화합니다.

대상

대체 LLM 아키텍처에 관심이 있는 연구자 및 개발자, 특히 자기회귀 모델의 대안으로 확산 기반 언어 모델링을 탐구하는 분들을 위한 모델입니다.

주요 특징

  • 규모: 처음부터 학습된 8B 파라미터 모델로, 성능 면에서 LLaMA3 8B와 경쟁합니다.
  • 아키텍처 유연성: 시간 $t$를 입력으로 필요로 하지 않는 표준 Transformer 아키텍처를 사용합니다.
  • MoE 변형: Mixture-of-Experts 아키텍처로 처음부터 사전 학습된 최초의 확산 언어 모델인 LLaDA-MoE를 포함합니다.
  • 멀티모달 확장: LLaDA-V는 확산 기반 접근 방식을 시각-언어 모델링으로 확장합니다。
  • 효율성 개선: iLLaDA 버전은 벤치마크 성능과 생성 효율성을 모두 향상시킵니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch