apple-aiml-research/ml-mdm

Train high-quality text-to-image diffusion models in a data & compute efficient manner

解決する課題

高解像度拡散モデルのトレーニングにおける計算コストと最適化の課題に対処します。具体的には、CC12Mのような比較的小規模なデータセットでも、最大1024x1024ピクセルの解像度で高品質なテキストから画像へのモデルを効率的にトレーニングできるようにします。

仕組み

このプロジェクトは「マトリョーシカ拡散モデル」を実装しており、単一のピクセル空間モデルで複数の解像度を処理できるようにする技術です。U-NetおよびNested U-Netの実装を含むエンドツーエンドのフレームワークを提供し、DDPMなどのパイプラインをサポートします。このシステムはスケーラビリティを考慮して設計されており、torchrunによる並列トレーニングや、大規模なデータセットの保存と取得のためのS3統合をサポートしています。

対象者

画像およびビデオ合成に取り組む研究者や開発者で、高解像度拡散モデルを効率的にトレーニングしたい方、またはテキストから画像への生成に事前トレーニング済みチェックポイントを使用したい方を対象としています。

ハイライト

  • マルチ解像度対応: 64、256、1024ピクセルの解像度で画像を生成できます。
  • スケーラブルなトレーニング: 並列トレーニングとCC12Mなどのデータセットのデータスクレイピングのためのツールが含まれています。
  • S3統合: 正規表現を使用してS3バケットからデータセットを直接ロードおよびフィルタリングできます。
  • Webデモ: 事前トレーニング済みモデルからサンプルを生成するためのすぐに使えるWeb UIを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト