viiika/Meissonic
[ICLR 2025] Official Implementation of Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis
해결하는 문제
Meissonic은 소비자급 하드웨어에서 고해상도 이미지를 효율적으로 생성하는 과제를 해결합니다. Masked Generative Transformer (MGT) 접근 방식을 재활성화하여 기존의 텍스트-이미지 합성의 비자기회귀적 대안을 제공하며, 고해상도 출력과 관련된 일반적인 계산 부담을 줄입니다.
작동 방식
Meissonic은 비자기회귀 마스크 이미지 모델링 방식을 사용합니다. 픽셀이나 토큰을 순차적으로 생성하는 자기회귀 모델과 달리, Meissonic은 마스킹 프로세스를 통해 이미지의 여러 부분을 동시에 예측합니다. 고해상도 합성(최대 1024x1024)을 지원하며, FP8 양자화를 사용하여 메모리 사용량을 줄이고 소비자용 GPU에서 성능을 유지하도록 추가 최적화할 수 있습니다.
대상
이 프로젝트는 생성형 AI를 연구하는 연구자 및 개발자뿐만 아니라, 자신의 하드웨어에서 고해상도 텍스트-이미지 생성 및 이미지-이미지 작업(인페인팅 및 아웃페인팅 등)을 실행하고자 하는 아티스트 및 크리에이터를 위해 설계되었습니다.
주요 특징
- 고해상도: 최대 1024x1024 픽셀의 이미지 생성을 지원합니다.
- 소비자용 GPU 친화적: 소비자용 그래픽 카드에 최적화되어 있으며, FP8 양자화 사용 시 메모리 사용량이 8.7GB로 낮습니다.
- 다양한 응용 분야: 텍스트-이미지, 이미지-이미지, 인페인팅 및 아웃페인팅을 지원합니다.
- 학습 지원: 사용자 정의 데이터셋에서 모델을 학습시키기 위한 스크립트와 가이드라인이 포함되어 있습니다.
관련
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트