NVlabs/Sana
SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformer
解決的問題
SANA 提供了一個面向效率的高解析度圖像與影片生成框架。它解決了通常與生成 4K 圖像或長影片相關的高計算成本與記憶體需求問題,使得在消費級硬體(包括顯存小於 8GB 的筆記型電腦 GPU)上實現這些功能成為可能。
工作原理
SANA 採用了幾項關鍵的架構優化來減輕硬體負擔:
- Linear Attention: 取代了 Diffusion Transformers (DiT) 中的標準 Attention,以在高解析度下保持效率。
- DC-AE: 使用 32x 圖像壓縮(相比標準的 8x)來顯著減少潛在 token 的數量。
- Decoder-only Text Encoder: 利用現代 LLM 實現更好的文本-圖像對齊與上下文學習。
- 專用影片模組: 使用 Block Causal Linear Attention 與 Causal Mix-FFN 進行長影片生成,並使用 sCM distillation 實現單步生成 (SANA-Sprint)。
- 量化: 支援 4-bit 與 8-bit 量化以降低 VRAM 使用量。
適用對象
SANA 專為構建高解析度生成式 AI 應用程式的研究人員與開發人員,以及希望在有限硬體上執行高品質圖像與影片生成的使用者而設計。
亮點
- 高解析度: 支援高達 4K 解析度的文本到圖像生成。
- 極速體驗: SANA-Sprint 在 H100 上僅需 0.1 秒即可生成 1024px 圖像。
- 多模態能力: 包括用於圖像生成、影片生成 (SANA-Video)、世界建模 (SANA-WM) 以及即時串流影片編輯 (SANA-Streaming) 的專用模型。
- 硬體友善: 透過 4-bit 量化,能夠在顯存 < 8GB 的 GPU 上執行。
- RL 整合: 包含 Sol-RL,用於在訓練後階段實現更快的強化學習收斂。