inclusionAI/LLaDA2.X

LLaDA2.0 is the diffusion language model series developed by InclusionAI team, Ant Group.

해결하는 문제

LLaDA2.X는 확산 기반 텍스트 생성을 1,000억 파라미터 수준으로 확장하도록 설계된 일련의 이산 확산 대규모 언어 모델(dLLM)로, 추론 속도 및 아키텍처 측면에서 기존 자기회귀 모델의 한계를 극복합니다.

작동 원리

이 프로젝트는 언어 모델링을 위한 이산 확산 프로세스를 구현합니다. Mixture-of-Experts (MoE) 아키텍처를 사용하여 모델 크기를 확장합니다 (LLaDA2.0-flash 변형의 경우 최대 100B 파라미터). 효율성을 높이기 위해 병렬 디코딩 메커니즘과 KV-Cache 재사용 및 블록 수준 병렬 디코딩을 지원하는 dInfer 및 SGLang 기반의 커스텀 추론 엔진을 채택했습니다.

대상

복잡한 지시 이행 및 코드 생성 작업을 대규모로 처리할 수 있는 고성능 텍스트 생성 모델이 필요한 연구자 및 개발자, 특히 표준 자기회귀 LLM의 대안을 찾는 분들에게 적합합니다.

주요 특징

  • 100B 파라미터 규모: 1,000억 파라미터에 도달한 최초의 확산 언어 모델.
  • 추론 가속: Confidence-Aware Parallel (CAP) 디코딩을 사용하여 최대 535 tokens/s 달성.
  • MoE 아키텍처: 확장 시 성능을 유지하기 위해 Mixture-of-Experts 사용.
  • 오픈 소스: Hugging Face에서 모델 가중치와 학습 코드를 완전히 오픈 소스로 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트