viiika/Meissonic

[ICLR 2025] Official Implementation of Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis

解决的问题

Meissonic 解决了在消费级硬件上高效生成高分辨率图像的挑战。它重塑了掩码生成 Transformer (MGT) 方法,为传统的文本到图像合成提供了一种非自回归的替代方案,减轻了通常与高分辨率输出相关的计算负担。

工作原理

Meissonic 使用非自回归掩码图像建模方法。与顺序生成像素或标记的自回归模型不同,Meissonic 通过掩码过程同时预测图像的多个部分。它支持高分辨率合成(最高 1024x1024),并可以通过 FP8 量化进一步优化,以减少内存占用并保持在消费级 GPU 上的性能。

适用对象

该项目专为从事生成式 AI 研究的学者和开发人员,以及希望在自有硬件上运行高分辨率文本到图像生成和图像到图像任务(如局部重绘和外扩绘制)的艺术家和创作者而设计。

亮点

  • 高分辨率:支持高达 1024x1024 像素的图像生成。
  • 对消费级 GPU 友好:针对消费级显卡进行了优化,使用 FP8 量化时内存占用低至 8.7GB。
  • 多功能应用:支持文本到图像、图像到图像、局部重绘和外扩绘制。
  • 训练支持:包含在自定义数据集上训练模型的脚本和指南。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目