NVlabs/Sana

SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformer

解決的問題

SANA 提供了一個面向效率的高解析度圖像與影片生成框架。它解決了通常與生成 4K 圖像或長影片相關的高計算成本與記憶體需求問題,使得在消費級硬體(包括顯存小於 8GB 的筆記型電腦 GPU)上實現這些功能成為可能。

工作原理

SANA 採用了幾項關鍵的架構優化來減輕硬體負擔:

  • Linear Attention: 取代了 Diffusion Transformers (DiT) 中的標準 Attention,以在高解析度下保持效率。
  • DC-AE: 使用 32x 圖像壓縮(相比標準的 8x)來顯著減少潛在 token 的數量。
  • Decoder-only Text Encoder: 利用現代 LLM 實現更好的文本-圖像對齊與上下文學習。
  • 專用影片模組: 使用 Block Causal Linear Attention 與 Causal Mix-FFN 進行長影片生成,並使用 sCM distillation 實現單步生成 (SANA-Sprint)。
  • 量化: 支援 4-bit 與 8-bit 量化以降低 VRAM 使用量。

適用對象

SANA 專為構建高解析度生成式 AI 應用程式的研究人員與開發人員,以及希望在有限硬體上執行高品質圖像與影片生成的使用者而設計。

亮點

  • 高解析度: 支援高達 4K 解析度的文本到圖像生成。
  • 極速體驗: SANA-Sprint 在 H100 上僅需 0.1 秒即可生成 1024px 圖像。
  • 多模態能力: 包括用於圖像生成、影片生成 (SANA-Video)、世界建模 (SANA-WM) 以及即時串流影片編輯 (SANA-Streaming) 的專用模型。
  • 硬體友善: 透過 4-bit 量化,能夠在顯存 < 8GB 的 GPU 上執行。
  • RL 整合: 包含 Sol-RL,用於在訓練後階段實現更快的強化學習收斂。