NVlabs/Sana

SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformer

解决的问题

SANA 提供了一个面向效率的高分辨率图像和视频生成框架。它解决了通常与生成 4K 图像或长视频相关的计算成本和内存需求问题,使得在消费级硬件(包括显存小于 8GB 的笔记本电脑 GPU)上实现这些功能成为可能。

工作原理

SANA 采用了几种关键的架构优化来减轻硬件负担:

  • Linear Attention: 取代了 Diffusion Transformers (DiT) 中的标准 Attention,以在超高分辨率下保持效率。
  • DC-AE: 使用 32x 图像压缩(相比标准的 8x)来显著减少潜在 token 的数量。
  • Decoder-only Text Encoder: 利用现代 LLM 实现更好的文本-图像对齐和上下文学习。
  • 专用视频模块: 使用 Block Causal Linear Attention 和 Causal Mix-FFN 进行长视频生成,并使用 sCM distillation 实现单步生成 (SANA-Sprint)。
  • 量化: 支持 4-bit 和 8-bit 量化以降低 VRAM 使用量。

适用对象

SANA 专为构建高分辨率生成式 AI 应用的研究人员和开发人员,以及希望在有限硬件上运行高质量图像和视频生成的用户而设计。

亮点

  • 高分辨率: 支持高达 4K 分辨率的文本到图像生成。
  • 极速体验: SANA-Sprint 在 H100 上仅需 0.1 秒即可生成 1024px 图像。
  • 多模态能力: 包括用于图像生成、视频生成 (SANA-Video)、世界建模 (SANA-WM) 和实时流媒体视频编辑 (SANA-Streaming) 的专用模型。
  • 硬件友好: 通过 4-bit 量化,能够在显存 < 8GB 的 GPU 上运行。
  • RL 集成: 包含 Sol-RL,用于在训练后阶段实现更快的强化学习收束。