viiika/Meissonic

[ICLR 2025] Official Implementation of Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis

What it solves

Meissonic は、高解像度画像を効率的に生成するという課題に取り組みます。消費者向けのグラフィックカード(GPU)でも動作できる軽量さを保ちつつ、最大 1024x1024 ピクセルの画像を合成する手段を提供します。

How it works

Meissonic は非自己回帰型のマスクドイメージモデリング Transformer です。ピクセルやトークンを一つずつ生成する従来の自己回帰モデルとは異なり、マスク方式を用いて画像を合成します。テキストから画像への変換や画像から画像への変換タスクをサポートし、FP8 量子化による最適化でメモリ使用量を削減しながら性能を維持できます。

Who it’s for

このプロジェクトは、産業規模の計算リソースを必要とせずに自分のハードウェア上で高品質・高解像度の画像を生成したい AI 研究者、開発者、デジタルアーティスト向けです。

Highlights

  • High Resolution: Supports image generation up to 1024x1024.
  • Consumer GPU Friendly: Optimized for accessibility on home hardware.
  • Versatile Capabilities: Supports text-to-image, inpainting, and outpainting.
  • Performance Optimization: Includes FP8 quantization support to lower VRAM requirements to approximately 8.7GB.