viiika/Meissonic

[ICLR 2025] Official Implementation of Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis

解決的問題

Meissonic 解決了在消費級硬體上高效生成高解析度圖像的挑戰。它重塑了掩碼生成 Transformer (MGT) 方法,為傳統的文本到圖像合成提供了一種非自回歸的替代方案,減輕了通常與高解析度輸出相關的計算負擔。

工作原理

Meissonic 使用非自回歸掩碼圖像建模方法。與順序生成像素或標記的自回歸模型不同,Meissonic 透過掩碼過程同時預測圖像的多個部分。它支援高解析度合成(最高 1024x1024),並可以透過 FP8 量化進一步優化,以減少記憶體佔用並保持在消費級 GPU 上的效能。

適用對象

該專案專為從事生成式 AI 研究的研究人員與開發人員,以及希望在自有硬體上執行高解析度文本到圖像生成與圖像到圖像任務(如局部重繪與外擴繪製)的藝術家與創作者而設計。

亮點

  • 高解析度:支援高達 1024x1024 像素的圖像生成。
  • 對消費級 GPU 友善:針對消費級顯示卡進行了優化,使用 FP8 量化時記憶體佔用低至 8.7GB。
  • 多功能應用:支援文本到圖像、圖像到圖像、局部重繪與外擴繪製。
  • 訓練支援:包含在自定義數據集上訓練模型的腳本與指南。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • 專案