DiffusionGemma: 텍스트 확산을 통한 4배 빠른 텍스트 생성
DiffusionGemma: 텍스트 확산을 통한 4배 빠른 텍스트 생성
Google DeepMind has introduced DiffusionGemma, an experimental open model designed for high-speed text generation. By replacing sequential token-by-token processing with a text diffusion approach that generates entire blocks of text simultaneously, the model delivers up to 4x faster inference on dedicated GPUs.
High-Speed Inference and Hardware Optimization
DiffusionGemma shifts the decoding bottleneck from memory bandwidth to compute, allowing it to utilize GPU hardware more efficiently during local, low-concurrency inference. This approach enables significantly higher token output speeds compared to traditional autoregressive models.
- 성능 벤치마크: 이 모델은 단일 NVIDIA H100에서 초당 1000+ 토큰, NVIDIA GeForce RTX 5090에서 초당 700+ 토큰을 달성할 수 있습니다.
- 하드웨어 풋프린트: 추론 중에 केवल 3.8B 매개변수만 활성화하는 26B Mixture of Experts (MoE) 모델로서, DiffusionGemma는 양자화 시 고급 소비자 GPU의 18GB VRAM 한도 내에 들어갈 수 있습니다.
- 엔터프라이즈 및 소비자 지원: 이 모델은 Hopper 및 Blackwell 아키텍처를 포함한 NVIDIA 하드웨어에 최적화되어 있으며, NVFP4 (4-bit 부동소수점) 커널을 사용하여 거의 무손실 정확도로 처리량을 가속화합니다. RTX 4090 및 5090과 같은 소비자 GPU와 호환됩니다.
Technical Architecture: 텍스트 확산 vs. 자기회귀 생성
DiffusionGemma는 왼쪽에서 오른쪽으로 하나씩 토큰을 생성하는 표준 '타자기' 방식에서 벗어납니다. 대신, 그것은 '인쇄 프레스'처럼 작동하여 전체 256토큰 단락을 동시에 초안합니다.
확산 과정
이미지 생성 모델과 유사하게, DiffusionGemma는 반복적 정제 과정을 통해 텍스트를 생성합니다:
- 캔버스: 프로세스는 랜덤 플레이스홀더 토큰으로 이루어진 캔버스에서 시작됩니다.
- 반복적 정제: 모델은 여러 번의 패스를 수행하여 올바른 토큰을 고정하고, 이를 컨텍스트로 사용하여 남은 플레이스홀더를 정제합니다.
- 최종 다듬기: 텍스트는 최종 고품질 출력으로 수렴됩니다.
양방향 주의 및 비선형 생성
모델이 256개의 토큰을 병렬로 생성하기 때문에, 모든 토큰이 다른 모든 토큰에 주의할 수 있습니다. 이 양방향 주의는 미래 컨텍스트에 의존하는 토큰이 있는 비선형 작업에 명확한 장점을 제공합니다. 예를 들어:
- 인라인 편집 및 코드 인필링.
- 아미노산 시퀀스 또는 수학적 그래프 생성.
- 수수께끼 퍼즐 풀이 (자기회귀 모델이 일반적으로 어려워하는 작업).
사용 사례 및 프로덕션 트레이드오프
While DiffusionGemma offers extreme speed, it involves specific trade-offs regarding output quality and deployment environments.
품질 vs. 속도
DiffusionGemma는 최대 출력 품질보다 속도와 병렬 레이아웃 생성을 우선시합니다.最高 possible quality를 요구하는 애플리케이션의 경우, Google DeepMind는 표준 Gemma 4 모델을 권장합니다.
로컬 vs. 클라우드 배포
DiffusionGemma는 로컬 및 저동시성 추론에 특화되어 최적화되었습니다. 높은 QPS(초당 쿼리 수) 클라우드 환경에서는 자기회귀 모델이 수천 개의 요청을 배치하여 컴퓨팅을 포화시킬 수 있어 더 효율적입니다. 이러한 시나리오에서는 DiffusionGemma의 병렬 디코딩이 감소하는 수익을 제공하고 제공 비용을 증가시킬 수 있습니다.
가용성 및 통합
DiffusionGemma는 Apache 2.0 라이선스로 출시되었으며 Hugging Face를 통해 이용할 수 있습니다. 여러 개발 도구 및 프레임워크에서 지원되며, 포함됩니다:
- 서빙 프레임워크: MLX, Red Hat 통합이 있는 vLLM, 그리고 Hugging Face Transformers.
- 파인튜닝 도구: Hackable Diffusion (JAX 툴박스), Unsloth, 그리고 NVIDIA NeMo.
- 배포 플랫폼: Gemini Enterprise Agent Platform Model Garden 및 NVIDIA NIM.