viiika/Meissonic

[ICLR 2025] Official Implementation of Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis

解決する課題

Meissonicは、コンシューマーグレードのハードウェアで高解像度画像を効率的に生成するという課題に対処します。Masked Generative Transformer (MGT) アプローチを再活性化し、従来のテキストから画像への合成に代わる非自己回帰的な選択肢を提供することで、高解像度出力に通常伴う計算負荷を軽減します。

仕組み

Meissonicは、非自己回帰的なマスク画像モデリング手法を使用しています。ピクセルやトークンを逐次的に生成する自己回帰モデルとは異なり、Meissonicはマスキングプロセスを通じて画像の複数の部分を同時に予測します。高解像度合成(最大1024x1024)をサポートしており、FP8量子化を使用してさらに最適化することで、メモリ使用量を削減し、コンシューマー向けGPUでのパフォーマンスを維持できます。

対象者

このプロジェクトは、生成AIに取り組む研究者や開発者、および自身のハードウェアで高解像度のテキストから画像への生成や画像から画像へのタスク(インペインティングやアウトペインティングなど)を実行したいアーティストやクリエイター向けに設計されています。

ハイライト

  • 高解像度: 最大1024x1024ピクセルの画像生成をサポート。
  • コンシューマーGPUに最適化: コンシューマー向けグラフィックスカード向けに最適化されており、FP8量子化を使用するとメモリ使用量はわずか8.7GBです。
  • 多用途なアプリケーション: テキストから画像、画像から画像、インペインティング、アウトペインティングをサポート。
  • トレーニングサポート: カスタムデータセットでモデルをトレーニングするためのスクリプトとガイドラインが含まれています。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト