NVlabs/Sana
SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformer
해결하는 문제
SANA는 고해상도 이미지 및 비디오 생성을 위한 효율 중심 프레임워크를 제공합니다. 이는 일반적으로 4K 이미지 또는 장편 비디오 생성과 관련된 높은 계산 비용 및 메모리 요구 사항을 해결하여, 소비자급 하드웨어(8GB 미만의 VRAM을 가진 노트북 GPU 포함)에서도 이러한 기능을 사용할 수 있도록 합니다.
작동 원리
SANA는 하드웨어 부담을 줄이기 위해 몇 가지 핵심적인 아키텍처 최적화를 채택합니다:
- Linear Attention: Diffusion Transformers (DiT)의 표준 Attention을 대체하여 고해상도에서도 효율성을 유지합니다.
- DC-AE: 32x 이미지 압축(표준 8x와 비교)을 사용하여 잠재 토큰(latent tokens)의 수를 크게 줄입니다.
- Decoder-only Text Encoder: 최신 LLM을 활용하여 더 나은 텍스트-이미지 정렬 및 인컨텍스트 학습을 실현합니다.
- Specialized Video Modules: 긴 비디오 생성을 위해 Block Causal Linear Attention 및 Causal Mix-FFN을 사용하며, 1단계 생성을 위해 sCM distillation(SANA-Sprint)을 사용합니다.
- Quantization: VRAM 사용량을 낮추기 위해 4-bit 및 8-bit 양자화를 지원합니다.
대상 사용자
SANA는 고해상도 생성형 AI 애플리케이션을 구축하는 연구자 및 개발자뿐만 아니라, 제한된 하드웨어에서 고품질 이미지 및 비디오 생성을 실행하고자 하는 사용자들을 위해 설계되었습니다.
주요 특징
- 고해상도: 최대 4K 해상도까지 텍스트-이미지 생성을 지원합니다.
- 극한의 속도: SANA-Sprint는 H100에서 1024px 이미지를 단 0.1초 만에 생성할 수 있습니다.
- 다양한 모달리티: 이미지 생성, 비디오 생성 (SANA-Video), 월드 모델링 (SANA-WM), 실시간 스트리밍 비디오 편집 (SANA-Streaming)을 위한 전문 모델이 포함되어 있습니다.
- 하드웨어 접근성: 4-bit 양자화를 통해 8GB 미만의 VRAM을 가진 GPU에서도 실행 가능합니다.
- RL 통합: 사후 학습(post-training) 중 더 빠른 강화 학습 수렴을 위한 Sol-RL을 포함합니다.