apple-aiml-research/ml-mdm
Train high-quality text-to-image diffusion models in a data & compute efficient manner
解決的問題
它解決了訓練高解析度擴散模型時的計算和最佳化挑戰。具體來說,它允許在最高1024x1024像素的解析度下高效訓練高品質的文字到圖像模型,即使使用像CC12M這樣相對較小的資料集也能實現。
運作方式
此專案實作了「套娃擴散模型」,這是一種使單一像素空間模型能夠處理多種解析度的技術。它提供了一個端到端的框架,包括U-Net和巢狀U-Net的實作,並支援DDPM等管道。該系統專為可擴充性而設計,支援透過torchrun進行平行訓練,並支援與S3整合,用於大規模資料集的儲存和擷取。
適用對象
從事影像和視訊合成的研究人員和開發人員,他們希望高效訓練高解析度擴散模型,或使用預訓練檢查點進行文字到圖像生成。
亮點
- 多解析度支援:能夠生成64、256和1024像素解析度的影像。
- 可擴充訓練:包括用於平行訓練和CC12M等資料集資料抓取的工具。
- S3整合:支援使用正規表示式從S3儲存桶直接載入和篩選資料集。
- Web示範:提供即用型Web UI,用於從預訓練模型生成樣本。
相關
- 專案
- 專案
- 專案
- 專案