apple-aiml-research/ml-mdm
Train high-quality text-to-image diffusion models in a data & compute efficient manner
解决的问题
它解决了训练高分辨率扩散模型时的计算和优化挑战。具体来说,它允许在高达1024x1024像素的分辨率下高效训练高质量的文本到图像模型,即使使用像CC12M这样相对较小的数据集也能实现。
工作原理
该项目实现了“套娃扩散模型”,这是一种使单个像素空间模型能够处理多种分辨率的技术。它提供了一个端到端的框架,包括U-Net和嵌套U-Net的实现,并支持DDPM等管道。该系统专为可扩展性而设计,支持通过torchrun进行并行训练,并支持与S3集成,用于大规模数据集的存储和检索。
适用对象
从事图像和视频合成的研究人员和开发人员,他们希望高效训练高分辨率扩散模型,或使用预训练检查点进行文本到图像生成。
亮点
- 多分辨率支持:能够生成64、256和1024像素分辨率的图像。
- 可扩展训练:包括用于并行训练和CC12M等数据集数据抓取的工具。
- S3集成:支持使用正则表达式从S3存储桶直接加载和过滤数据集。
- Web演示:提供即用型Web UI,用于从预训练模型生成样本。
相关
- 项目
- 项目
- 项目
- 项目