NVlabs/Sana
SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformer
解决的问题
SANA 提供了一个面向效率的高分辨率图像和视频生成框架。它解决了通常与生成 4K 图像或长视频相关的计算成本和内存需求问题,使得在消费级硬件(包括显存小于 8GB 的笔记本电脑 GPU)上实现这些功能成为可能。
工作原理
SANA 采用了几种关键的架构优化来减轻硬件负担:
- Linear Attention: 取代了 Diffusion Transformers (DiT) 中的标准 Attention,以在超高分辨率下保持效率。
- DC-AE: 使用 32x 图像压缩(相比标准的 8x)来显著减少潜在 token 的数量。
- Decoder-only Text Encoder: 利用现代 LLM 实现更好的文本-图像对齐和上下文学习。
- 专用视频模块: 使用 Block Causal Linear Attention 和 Causal Mix-FFN 进行长视频生成,并使用 sCM distillation 实现单步生成 (SANA-Sprint)。
- 量化: 支持 4-bit 和 8-bit 量化以降低 VRAM 使用量。
适用对象
SANA 专为构建高分辨率生成式 AI 应用的研究人员和开发人员,以及希望在有限硬件上运行高质量图像和视频生成的用户而设计。
亮点
- 高分辨率: 支持高达 4K 分辨率的文本到图像生成。
- 极速体验: SANA-Sprint 在 H100 上仅需 0.1 秒即可生成 1024px 图像。
- 多模态能力: 包括用于图像生成、视频生成 (SANA-Video)、世界建模 (SANA-WM) 和实时流媒体视频编辑 (SANA-Streaming) 的专用模型。
- 硬件友好: 通过 4-bit 量化,能够在显存 < 8GB 的 GPU 上运行。
- RL 集成: 包含 Sol-RL,用于在训练后阶段实现更快的强化学习收束。