apple-aiml-research/ml-mdm

Train high-quality text-to-image diffusion models in a data & compute efficient manner

解決的問題

它解決了訓練高解析度擴散模型時的計算和最佳化挑戰。具體來說,它允許在最高1024x1024像素的解析度下高效訓練高品質的文字到圖像模型,即使使用像CC12M這樣相對較小的資料集也能實現。

運作方式

此專案實作了「套娃擴散模型」,這是一種使單一像素空間模型能夠處理多種解析度的技術。它提供了一個端到端的框架,包括U-Net和巢狀U-Net的實作,並支援DDPM等管道。該系統專為可擴充性而設計,支援透過torchrun進行平行訓練,並支援與S3整合,用於大規模資料集的儲存和擷取。

適用對象

從事影像和視訊合成的研究人員和開發人員,他們希望高效訓練高解析度擴散模型,或使用預訓練檢查點進行文字到圖像生成。

亮點

  • 多解析度支援:能夠生成64、256和1024像素解析度的影像。
  • 可擴充訓練:包括用於平行訓練和CC12M等資料集資料抓取的工具。
  • S3整合:支援使用正規表示式從S3儲存桶直接載入和篩選資料集。
  • Web示範:提供即用型Web UI,用於從預訓練模型生成樣本。

相關

  • 專案
  • 專案
  • 專案
  • 專案