SDXL と Stable Diffusion の 高速 推論 と Latent Consistency LoRAs
Hugging Face は Latent Consistency LoRAs (LCM LoRAs) を導入 し、Stable Diffusion と SDXL モデル が 通常 の 25 ~ 50 ステップ と 比較 し た 4 ~ 8 ステップ で 高品質 な 画像 を 生成 できる よう に しました。この 進歩 は 推論 時間 を 大幅 に 短縮 し、ハイエンド GPU で ほぼ リアルタイム の 画像 生成 を 可能 に し、低スペック ハードウェア の アクセシビリティ を 大幅 に 向上 させます。
LCM LoRA メソッド オーバービュー
LCM LoRAs は Low-Rank Adaptation (LoRA) を 利用 し、フル モデル を 個別に 蒸留 する 必要 が ない latent consistency distillation を 実装 します。コスト が 高く データ 集約 的 な フル モデル 蒸留 プロセス の 代わり に、少数 の アダプター レイヤー が 訓練 されます。これら の 結果 の LoRAs は、ベース モデル の 任意 の ファインチューン バージョン に 適用 でき 、様々な モデル バージョン に 跨 い て latent consistency distillation の 利点 を 提供 します。
実装 プロセス は 主に 3 つ の ステップ から なり ます:
- 教師 モデル を 選択 する(例:SDXL ベース または ファインチューン バージョン)。
- Parameter-Efficient Fine-Tuning (PEFT) を 使 って LCM LoRA を 訓練 する。
- 任意 の SDXL 拡散 モデル と
LCMSchedulerを 使 って LoRA を 適用 し、高品質 で 低ステップ の 推論 を 実現 する。
パフォーマンス ベンチマーク と ハードウェア インパクト
LCM LoRAs は 様々な ハードウェア 構成 に おけ て 画像 生成 時間 を 桁違い に 短縮 します。1024x1024 の 画像 に つき 、速度 の 改善 は 以下 の とおり です:
| ハードウェア | SDXL LoRA LCM (4 ステップ) | SDXL 標準 (25 ステップ) |
|---|---|---|
| Mac, M1 Max | 6.5s | 64s |
| 2080 Ti | 4.7s | 10.2s |
| 3090 | 1.4s | 7s |
| 4090 | 0.7s | 3.4s |
| T4 (Google Colab Free) | 8.4s | 26.5s |
| A100 (80 GB) | 1.2s | 3.8s |
| Intel i9-10980XE CPU | 29s | 219s |
NVIDIA RTX 4090 では 応答 時間 が 1 秒 未満 に な り 、リアルタイム 相互作用 を 必要 と す る アプリケーション で SDXL を 使用 できる よう に なり ます。M1 Mac では 、生成 時間 が 約 1 分 から 約 6 秒 に 減少 し ます。
品質、ガイダンス、および モデル 互換性
推論 品質 vs. ステップ数
1 ステップ 生成 は テクスチャ なし の おおよその 形状 の み を 生成 し ます が、品質 は 4 ~ 6 ステップ の 間 で 急速 に 向上 し ます。標準 の SDXL パイプライン と 比較 すると、約 20 ステップ まで 使用 でき な い 画像 が 生成 さ れ 、ピーク の 詳細 を 得る には 50 ステップ が 必要 で す。
ガイダンス スケール と ネガティブ プロンプト
最大 の 速度 を 出す ため には、guidance_scale が 1 の 使用 を 推奨 し ます。これにより ガイダンス が 実質 的 に 無効 に な り ます。ネガティブ プロンプト を 利用 する 場合 は、ガイダンス スケール を 1 と 2 の 間 に 設定 でき ます が、2 を 超える 値 は 一般 的 に 効果 が な い です。
ファインチューン モデル と の 互換性
LCM LoRAs は 、任意 の ファインチューン さ れ た SDXL または Stable Diffusion モデル と 互換 性 が あ り ます。たとえば 、collage-diffusion(Stable Diffusion v1.5 の Dreambooth ファインチューン)に 対応 する SD v1.5 用 の LCM LoRA を 読み込む こと で 、この 手法 を 適用 でき 、専門 的 な スタイル に つき 4 ステップ の 推論 を 可能 に し ます。
統合 と 高度な ワークフロー
Diffusers 統合
LCM は diffusers ライブラリ に 完全 に 統合 さ れ て い り 、以下 の 機能 へ の アクセス を 提供 し ます:
- Apple Silicon 向け の ネイティブ
mpsサポート。 torch.compile()と flash attention を 含 む パフォーマンス 最適化。- 低 RAM 環境 向け の モデル オフロード など の メモリ 削減 戦略。
- ControlNet と image-to-image ワークフロー の サポート。
LoRAs の 組み合わせ
diffusers と PEFT の 統合 を 使 用 し 、ユーザー は LCM LoRAs と 通常 の SDXL LoRAs を 組み合わせ る こと が でき ます。これにより 、CiroN2022/toy_face の よう な 専門 的 な スタイル または 被写体 LoRAs も 、複数 の アダプター と それぞ れ の 重み を 設定 する こと で 、LCM プロセス の 4 ステップ 推論 の 速度 の 利点 を 得る こと が でき ます。
利用可能 な モデル と リソース
Hugging Face は いくつか の LCM LoRAs と フル モデル を 公開 し て い り ます:
- LCM LoRAs: SDXL 1.0 ベース、Stable Diffusion v1.5、および Segmind の SSD-1B(SDXL の 蒸留 モデル)に 利用 可能 で す。
- フル モデル: SDXL 1.0 ベース と SSD-1B から 導出 さ れ た フル ファインチューン consistency モデル。
Stable Diffusion 1.5 と SDXL の 両方 に つき 、diffusers リポジトリ 内 で 訓練 と ファインチューン スクリプト が 今 利用 可能 と な り 、コミュニティ は フル モデル 蒸留 または より アクセス し やす い LCM LoRA 訓練 の いずれか を 実行 でき る よう に なり ます。