viiika/Meissonic
[ICLR 2025] Official Implementation of Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis
What it solves
Meissonic 解決了高效產生高解析度影像的挑戰。它提供了一種在消費級顯示卡(GPU)上執行的輕量化方案,能合成最高 1024x1024 像素的影像。
How it works
Meissonic 是一種非自回歸的遮罩影像建模 Transformer。不同於傳統的自回歸模型逐像素或逐 token 產生,Meissonic 採用遮罩方式合成影像。它支援文字到影像以及影像到影像的任務,並且可以透過 FP8 量化進一步優化,以降低記憶體使用並維持效能。
Who it’s for
本專案面向希望在自有硬體上產生高品質、高解析度影像、且不依賴工業級運算資源的 AI 研究者、開發者與數位藝術家。
Highlights
- High Resolution: Supports image generation up to 1024x1024.
- Consumer GPU Friendly: Optimized for accessibility on home hardware.
- Versatile Capabilities: Supports text-to-image, inpainting, and outpainting.
- Performance Optimization: Includes FP8 quantization support to lower VRAM requirements to approximately 8.7GB.