modelscope/DiffSynth-Studio

Enjoy the magic of Diffusion models!

何を解決するか

DiffSynth-Studio は、生成モデルのデプロイとトレーニングを簡素化するオープンソースの拡散モデルエンジンです。大規模な拡散モデルに通常伴う高コストなハードウェア要件を、高度なメモリ管理と量子化技術により克服し、コンシューマー向けGPUでもこれらのモデルを活用可能にします。

どう動くか

このフレームワークは、さまざまなモダリティの主流のオープンソース拡散モデルを統合しています。動的スケジューリングシステムにより、モデルパラメータをディスク、メモリ、VRAMの間で移動させ、リソース使用を最適化します。さらにメモリ使用量を削減するために、パラメータの量子化(NF4やINT8など)とCPUオフロードトレーニングをサポートしており、トレーニング中に層ごとにモデル重みを移動できます。

誰向けか

画像、動画、音声の生成モデルの推論やトレーニング(LoRAやAdapterモデルを含む)を、限られたハードウェアリソースを持つ開発者や研究者向けです。

特徴

  • マルチモーダル対応: 画像、動画、音声生成モデル、および画像品質メトリクスを統合。
  • VRAM管理: ディスク、メモリ、VRAM間でのパラメータの動的スケジューリングにより、低VRAMGPUをサポート。
  • 高度な量子化: 推論およびトレーニングの両方でVRAM要件を削減するNF4およびINT8量子化をサポート。
  • 柔軟なトレーニング: ベースモデルトレーニング、LoRA、Adapterモデルをサポート。計算グラフ推論エンジンを用いた特別な「スプリットトレーニング」プロセスも提供。
  • CPUオフロードトレーニング: CPUとGPU間で層ごとに重みを移動することで、コンシューマーGPU上で大規模モデルのトレーニングを可能に。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト