SDXL と Stable Diffusion の 高速 推論 と Latent Consistency LoRAs

Hugging Face は Latent Consistency LoRAs (LCM LoRAs) を導入 し、Stable Diffusion と SDXL モデル が 通常 の 25 ~ 50 ステップ と 比較 し た 4 ~ 8 ステップ で 高品質 な 画像 を 生成 できる よう に しました。この 進歩 は 推論 時間 を 大幅 に 短縮 し、ハイエンド GPU で ほぼ リアルタイム の 画像 生成 を 可能 に し、低スペック ハードウェア の アクセシビリティ を 大幅 に 向上 させます。

LCM LoRA メソッド オーバービュー

LCM LoRAs は Low-Rank Adaptation (LoRA) を 利用 し、フル モデル を 個別に 蒸留 する 必要 が ない latent consistency distillation を 実装 します。コスト が 高く データ 集約 的 な フル モデル 蒸留 プロセス の 代わり に、少数 の アダプター レイヤー が 訓練 されます。これら の 結果 の LoRAs は、ベース モデル の 任意 の ファインチューン バージョン に 適用 でき 、様々な モデル バージョン に 跨 い て latent consistency distillation の 利点 を 提供 します。

実装 プロセス は 主に 3 つ の ステップ から なり ます:

  1. 教師 モデル を 選択 する(例:SDXL ベース または ファインチューン バージョン)。
  2. Parameter-Efficient Fine-Tuning (PEFT) を 使 って LCM LoRA を 訓練 する。
  3. 任意 の SDXL 拡散 モデル と LCMScheduler を 使 って LoRA を 適用 し、高品質 で 低ステップ の 推論 を 実現 する。

パフォーマンス ベンチマーク と ハードウェア インパクト

LCM LoRAs は 様々な ハードウェア 構成 に おけ て 画像 生成 時間 を 桁違い に 短縮 します。1024x1024 の 画像 に つき 、速度 の 改善 は 以下 の とおり です:

ハードウェア SDXL LoRA LCM (4 ステップ) SDXL 標準 (25 ステップ)
Mac, M1 Max 6.5s 64s
2080 Ti 4.7s 10.2s
3090 1.4s 7s
4090 0.7s 3.4s
T4 (Google Colab Free) 8.4s 26.5s
A100 (80 GB) 1.2s 3.8s
Intel i9-10980XE CPU 29s 219s

NVIDIA RTX 4090 では 応答 時間 が 1 秒 未満 に な り 、リアルタイム 相互作用 を 必要 と す る アプリケーション で SDXL を 使用 できる よう に なり ます。M1 Mac では 、生成 時間 が 約 1 分 から 約 6 秒 に 減少 し ます。

品質、ガイダンス、および モデル 互換性

推論 品質 vs. ステップ数

1 ステップ 生成 は テクスチャ なし の おおよその 形状 の み を 生成 し ます が、品質 は 4 ~ 6 ステップ の 間 で 急速 に 向上 し ます。標準 の SDXL パイプライン と 比較 すると、約 20 ステップ まで 使用 でき な い 画像 が 生成 さ れ 、ピーク の 詳細 を 得る には 50 ステップ が 必要 で す。

ガイダンス スケール と ネガティブ プロンプト

最大 の 速度 を 出す ため には、guidance_scale が 1 の 使用 を 推奨 し ます。これにより ガイダンス が 実質 的 に 無効 に な り ます。ネガティブ プロンプト を 利用 する 場合 は、ガイダンス スケール を 1 と 2 の 間 に 設定 でき ます が、2 を 超える 値 は 一般 的 に 効果 が な い です。

ファインチューン モデル と の 互換性

LCM LoRAs は 、任意 の ファインチューン さ れ た SDXL または Stable Diffusion モデル と 互換 性 が あ り ます。たとえば 、collage-diffusion(Stable Diffusion v1.5 の Dreambooth ファインチューン)に 対応 する SD v1.5 用 の LCM LoRA を 読み込む こと で 、この 手法 を 適用 でき 、専門 的 な スタイル に つき 4 ステップ の 推論 を 可能 に し ます。

統合 と 高度な ワークフロー

Diffusers 統合

LCM は diffusers ライブラリ に 完全 に 統合 さ れ て い り 、以下 の 機能 へ の アクセス を 提供 し ます:

  • Apple Silicon 向け の ネイティブ mps サポート。
  • torch.compile() と flash attention を 含 む パフォーマンス 最適化。
  • 低 RAM 環境 向け の モデル オフロード など の メモリ 削減 戦略。
  • ControlNet と image-to-image ワークフロー の サポート。

LoRAs の 組み合わせ

diffusers と PEFT の 統合 を 使 用 し 、ユーザー は LCM LoRAs と 通常 の SDXL LoRAs を 組み合わせ る こと が でき ます。これにより 、CiroN2022/toy_face の よう な 専門 的 な スタイル または 被写体 LoRAs も 、複数 の アダプター と それぞ れ の 重み を 設定 する こと で 、LCM プロセス の 4 ステップ 推論 の 速度 の 利点 を 得る こと が でき ます。

利用可能 な モデル と リソース

Hugging Face は いくつか の LCM LoRAs と フル モデル を 公開 し て い り ます:

  • LCM LoRAs: SDXL 1.0 ベース、Stable Diffusion v1.5、および Segmind の SSD-1B(SDXL の 蒸留 モデル)に 利用 可能 で す。
  • フル モデル: SDXL 1.0 ベース と SSD-1B から 導出 さ れ た フル ファインチューン consistency モデル。

Stable Diffusion 1.5 と SDXL の 両方 に つき 、diffusers リポジトリ 内 で 訓練 と ファインチューン スクリプト が 今 利用 可能 と な り 、コミュニティ は フル モデル 蒸留 または より アクセス し やす い LCM LoRA 訓練 の いずれか を 実行 でき る よう に なり ます。

Sources