modelscope/DiffSynth-Studio

Enjoy the magic of Diffusion models!

What it solves

DiffSynth-Studio は、Diffusion モデルを扱うための統一されたオープンソースエンジンを提供し、研究者や開発者が生成 AI を探索、トレーニング、デプロイする際の技術的ハードルを下げます。最先端モデルの統合や、トレーニング・推論時の GPU VRAM などハードウェア制約の管理という複雑さに対処します。

How it works

テキストから画像、画像編集、音声から動画、テキストから音楽まで、幅広いモダリティをサポートする柔軟なフレームワークです。レイヤーレベルのディスクオフロードや CPU オフロードトレーニングといった高度なメモリ管理技術を実装し、コンシューマーグレードのハードウェアでも大規模モデルを使用可能にします。また、"Diffusion Templates" と呼ばれるプラグイン型フレームワークを提供し、制御可能な生成モデルの作成を簡素化します。

Who it’s for

  • Academic Researchers:積極的な技術探索と最先端モデル機能を追求する研究者。
  • AI Developers:"wild ideas" を迅速に実現したい、または外部 Diffusion モデルをワークフローに組み込みたい開発者。
  • Content Creators:高性能な生成モデルを活用して画像、動画、音声の合成を行いたいクリエイター。

Highlights

  • Broad Model Support:FLUX.2、Z-Image、Wan、LTX-2、Qwen-Image など多数のモデルを統合。
  • VRAM Optimization:CPU オフロードトレーニングとレイヤーレベルのディスクオフロードにより GPU メモリ要件を低減。
  • Advanced Training Tools:Split Training(データ処理とトレーニングの分離)、Differential LoRA、FP8 精度トレーニングをサポート。
  • Multimodal Capabilities:テキスト→画像、画像→動画、音声駆動動画生成、テキスト→音楽をサポート。
  • Diffusion Templates:制御可能な生成モデルのトレーニング用に特化したプラグインフレームワーク。