apple-aiml-research/ml-mdm
Train high-quality text-to-image diffusion models in a data & compute efficient manner
해결하는 문제
고해상도 확산 모델 학습의 계산 및 최적화 문제를 해결합니다. 구체적으로, CC12M과 같은 비교적 작은 데이터셋에서도 최대 1024x1024 픽셀 해상도의 고품질 텍스트-이미지 모델을 효율적으로 학습할 수 있게 합니다.
작동 방식
이 프로젝트는 단일 픽셀 공간 모델이 여러 해상도를 처리할 수 있게 하는 기술인 "마트료시카 확산 모델"을 구현합니다. U-Net 및 Nested U-Net 구현을 포함한 엔드투엔드 프레임워크를 제공하며, DDPM과 같은 파이프라인을 지원합니다. 시스템은 확장성을 고려하여 설계되었으며, torchrun을 통한 병렬 학습과 대규모 데이터셋 저장 및 검색을 위한 S3 통합을 지원합니다.
대상
이미지 및 비디오 합성 작업을 하는 연구자와 개발자로, 고해상도 확산 모델을 효율적으로 학습하거나 텍스트-이미지 생성을 위해 사전 학습된 체크포인트를 사용하려는 사람들을 대상으로 합니다.
주요 기능
- 다중 해상도 지원: 64, 256, 1024 픽셀 해상도로 이미지를 생성할 수 있습니다.
- 확장 가능한 학습: 병렬 학습 및 CC12M과 같은 데이터셋의 데이터 스크래핑 도구가 포함되어 있습니다.
- S3 통합: 정규식을 사용하여 S3 버킷에서 데이터셋을 직접 로드하고 필터링할 수 있습니다.
- 웹 데모: 사전 학습된 모델에서 샘플을 생성할 수 있는 즉시 사용 가능한 웹 UI를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트