viiika/Meissonic

[ICLR 2025] Official Implementation of Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis

What it solves

Meissonic 解决了高效生成高分辨率图像的挑战。它提供了一种在消费级显卡(GPU)上运行的轻量化方案,能够合成最高 1024x1024 像素的图像。

How it works

Meissonic 是一种非自回归的遮罩图像建模 Transformer。不同于传统的自回归模型逐像素或逐 token 生成,Meissonic 采用遮罩方式合成图像。它支持文本到图像以及图像到图像的任务,并且可以通过 FP8 量化进一步优化,以降低内存占用并保持性能。

Who it’s for

本项目面向希望在自有硬件上生成高质量、高分辨率图像、且不依赖工业级算力资源的 AI 研究者、开发者和数字艺术家。

Highlights

  • High Resolution: Supports image generation up to 1024x1024.
  • Consumer GPU Friendly: Optimized for accessibility on home hardware.
  • Versatile Capabilities: Supports text-to-image, inpainting, and outpainting.
  • Performance Optimization: Includes FP8 quantization support to lower VRAM requirements to approximately 8.7GB.