aMUSEd:高效文本到图像生成
Hugging Face 推出了 aMUSEd,这是一款高效的非扩散文本到图像模型。作为 Google MUSE 的公开复现,aMUSEd 利用遮罩图像建模(MIM)提供比传统潜在扩散模型更快、更具可解释性的替代方案。
遮罩图像建模架构
aMUSEd 采用遮罩图像建模(MIM)方法,与潜在扩散相比,它能够使用更少的推理步骤并具有更高的可解释性。模型架构由三个主要组件组成:用于标记化的 VQGAN、用于提示嵌入的 CLIP-L/14 文本编码器,以及用于预测遮罩补丁的 U-ViT 模型。
训练过程
在训练期间,模型遵循以下步骤:
- Tokenization:使用 VQGAN 将输入图像转换为图像标记。
- Masking:根据余弦遮罩调度对图像标记进行遮罩。
- Prediction:将带有 CLIP-L/14 文本编码器生成的提示嵌入条件的遮罩标记传递给 U-ViT 模型,以预测遮罩补丁。
推理过程
在推理期间,模型通过迭代过程生成图像:
- Embedding:使用 CLIP-L/14 文本编码器对输入提示进行嵌入。
- Iterative Prediction:过程从随机遮罩的标记开始。U-ViT 模型预测遮罩标记,仅保留最有信心的预测的百分比(由遮罩调度和步骤数
N决定)。其余标记重新遮罩并再次传递给 U-ViT 模型。 - Decoding:最终输出通过 VQGAN 解码器生成最终图像。
与 MUSE 的关键区别
aMUSEd 与原始 MUSE 模型在三个关键方面不同:
- Single-Stage Prediction:它不使用两阶段方法来预测最终的遮罩补丁。
- Text Conditioning:它使用 CLIP L/14 而非 T5 来计算文本嵌入。
- Micro-conditioning:遵循 SDXL,它加入了图像尺寸和裁剪等额外条件。
能力与性能
aMUSEd 旨在实现高效与快速。模型约有 800M 参数(包括文本编码器和 VQ-GAN),性能表现出色。
推理速度与延迟
在 A100 GPU 上进行的基准测试显示,aMUSEd 的推理延迟显著低于其他模型。这种效率使其成为设备端应用的合适候选。
零样本图像修复
由于其预训练目标,aMUSEd 能够进行零样本图像修复,这一特性在诸如 SDXL 的模型中并不存在。
风格迁移
继承 MUSE 的能力,aMUSEd 展示了使用单张图像进行风格迁移的能力,为个性化和特定风格的图像生成提供了潜力。
微调与可访问性
aMUSEd 在 OpenRAIL 许可证下发布,商业友好。Hugging Face 提供了用于在自定义数据集上微调的训练脚本。
微调的硬件需求
- Standard Fine-Tuning:使用 8 位 Adam 优化器和 float16 精度,微调所需的 GPU 显存略低于 11GB。
- LoRA:使用低秩适配(LoRA),显存需求进一步降低至 7GB。
局限性
虽然 aMUSEd 在原始图像质量方面并非最先进,但其发布旨在鼓励社区探索 MIM 在图像生成中的潜力。作者强调了 MIM 框架的多项优势,包括推理效率、适用于设备端的更小模型体积,以及无需昂贵微调即可进行任务迁移的能力。