modelscope/DiffSynth-Studio
Enjoy the magic of Diffusion models!
何を解決するか
DiffSynth-Studio は、生成モデルのデプロイとトレーニングを簡素化するオープンソースの拡散モデルエンジンです。大規模な拡散モデルに通常伴う高コストなハードウェア要件を、高度なメモリ管理と量子化技術により克服し、コンシューマー向けGPUでもこれらのモデルを活用可能にします。
どう動くか
このフレームワークは、さまざまなモダリティの主流のオープンソース拡散モデルを統合しています。動的スケジューリングシステムにより、モデルパラメータをディスク、メモリ、VRAMの間で移動させ、リソース使用を最適化します。さらにメモリ使用量を削減するために、パラメータの量子化(NF4やINT8など)とCPUオフロードトレーニングをサポートしており、トレーニング中に層ごとにモデル重みを移動できます。
誰向けか
画像、動画、音声の生成モデルの推論やトレーニング(LoRAやAdapterモデルを含む)を、限られたハードウェアリソースを持つ開発者や研究者向けです。
特徴
- マルチモーダル対応: 画像、動画、音声生成モデル、および画像品質メトリクスを統合。
- VRAM管理: ディスク、メモリ、VRAM間でのパラメータの動的スケジューリングにより、低VRAMGPUをサポート。
- 高度な量子化: 推論およびトレーニングの両方でVRAM要件を削減するNF4およびINT8量子化をサポート。
- 柔軟なトレーニング: ベースモデルトレーニング、LoRA、Adapterモデルをサポート。計算グラフ推論エンジンを用いた特別な「スプリットトレーニング」プロセスも提供。
- CPUオフロードトレーニング: CPUとGPU間で層ごとに重みを移動することで、コンシューマーGPU上で大規模モデルのトレーニングを可能に。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト