NVlabs/Sana

SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformer

什么是 SANA

SANA(及其众多扩展)是 NVIDIA Research 开发的开源代码库,实现了一类用于高分辨率图像和视频生成的高效扩散模型。该仓库提供了端到端的训练和推理管道、模型检查点,以及与 Hugging Face DiffusersComfyUISGLangCosmos‑RL 等流行生态系统的集成工具。


核心组件

组件 功能 典型大小 / 分辨率
SANA 文本到图像扩散,最高支持 4K。声称参数量比 Flux‑12B 少约 20 倍,推理速度快约 100 倍。 1 K–4 K 像素图像
SANA‑1.5 在不改变模型架构的前提下,通过训练和推理时扩展计算量来提升质量。 与 SANA 相同
SANA‑Sprint 通过 sCM 蒸馏实现单步/少步生成。在 H100 上生成 1024 像素图像耗时约 0.1 秒。 1 K–2 K 像素图像
SANA‑Video / LongSANA 使用块线性注意力的扩散视频生成;支持实时生成长达 1 分钟的视频(约 27 FPS)。 720p–1080p,最长 1 分钟
SANA‑Video 2.0 具有混合线性/软最大注意力的 5B(及即将发布的 14B)文本到视频 / 文本-图像到视频模型。5B 720p 的演示已上线。 720p,8 秒片段
SANA‑WM 可控世界模型(2.6 B 参数),可生成带 6-DoF 相机控制的 1 分钟 720p 视频。 720p 视频
SANA‑Streaming 用于 720p、分钟级流媒体的实时视频到视频编辑(2B 参数)。 720p 视频
Sol‑RL 强化学习包装器(NVFP4 推演,BF16 训练),使扩散训练速度提升超过 4 倍。 与 SANA、FLUX‑1、SD3.5‑L 兼容

关键技术理念

  • 线性 / 块因果线性注意力 – 替代 DiT 中的二次成本注意力,使在中等 GPU 内存下实现高分辨率生成成为可能。
  • DC‑AE(32× 压缩) – 轻量级自编码器,将图像压缩为更少的潜在标记,进一步降低计算量。
  • 仅解码器文本编码器 – 利用现代 LLM 架构,增强文本-图像对齐能力,并支持上下文学习。
  • sCM 蒸馏 – 一种训练方法,使模型能在单次扩散步骤中生成高质量样本。
  • 推理时扩展(SANA‑1.5) – 运行时动态调整计算量(例如按标记或层),实现质量与速度的权衡。

谁会使用它?

  • 研究人员:探索高效扩散、线性注意力或多模态生成。
  • 开发者:构建需要低延迟或在有限硬件上运行的图像/视频生成服务(例如,4 位或 8 位量化模型,可放入 8 GB VRAM)。
  • 创意艺术家:希望实现高分辨率(2 K–4 K)图像生成或快速周转的短视频合成。
  • 机器人/具身AI团队:对世界模型生成(SANA‑WM)或基于 RL 的微调(Sol‑RL)感兴趣。

快速入门(快速启动指南)

  1. 克隆仓库
    git clone https://github.com/NVlabs/Sana.git && cd Sana
    
  2. 安装依赖项(仓库提供 environment.yml/requirements.txt)。
  3. 选择一个模型 – 检查点托管在 Hugging Face 的 Efficient‑Large‑Model 组织下(例如 SANA-Video_2.0_5B_720p)。
  4. 运行演示 – README 中链接了多个 Hugging Face Spaces;本地推理可使用 Diffusers 流水线:
    from diffusers import SanaPipeline
    pipe = SanaPipeline.from_pretrained("Efficient-Large-Model/SANA-Video_2.0_5B_720p")
    video = pipe("a sunrise over mountains", num_frames=24)
    
  5. 微调或 RL 训练 – 参考 docs/sol_rl/docs/sana/ 部分,使用 DDP/FSDP 脚本、4 位量化(CAME‑8bit),或使用 Cosmos‑RL 进行 RL 推演。

社区与支持

  • Discord: https://discord.gg/rde6eaE5Ta – 活跃讨论、故障排除和公告。
  • Hugging Face 模型库: 所有已发布检查点和 Diffusers 集成。
  • 演示站点: README 中链接了 SANA‑Sprint、SANA‑Video 2.0、SANA‑WM 和 SANA‑Streaming 的网页演示。
  • 论文与引用 – 多篇 arXiv 预印本(例如 2509.24695、2605.30409)已列出,提供科学背景。

许可证

代码采用 Apache 2.0 许可证(2025 年 1 月 11 日更新),允许商业使用、修改和再分发。


TL;DR

SANA 是一个生产级、以效率为核心的扩散框架,可在极低计算成本下训练和运行最先进的高分辨率图像和视频生成器。它提供即用型检查点、与主要 ML 库的集成,以及一系列扩展功能,支持单步快速生成、视频流、世界模型控制和基于 RL 的微调。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目