viiika/Meissonic
[ICLR 2025] Official Implementation of Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis
What it solves
Meissonic 解决了高效生成高分辨率图像的挑战。它提供了一种在消费级显卡(GPU)上运行的轻量化方案,能够合成最高 1024x1024 像素的图像。
How it works
Meissonic 是一种非自回归的遮罩图像建模 Transformer。不同于传统的自回归模型逐像素或逐 token 生成,Meissonic 采用遮罩方式合成图像。它支持文本到图像以及图像到图像的任务,并且可以通过 FP8 量化进一步优化,以降低内存占用并保持性能。
Who it’s for
本项目面向希望在自有硬件上生成高质量、高分辨率图像、且不依赖工业级算力资源的 AI 研究者、开发者和数字艺术家。
Highlights
- High Resolution: Supports image generation up to 1024x1024.
- Consumer GPU Friendly: Optimized for accessibility on home hardware.
- Versatile Capabilities: Supports text-to-image, inpainting, and outpainting.
- Performance Optimization: Includes FP8 quantization support to lower VRAM requirements to approximately 8.7GB.