Hugging Face Diffusers 1周年概要

Hugging Faceは、拡散モデルへのアクセスを民主化するために作成された 🤗 Diffusers ライブラリの1周年を迎えました。このライブラリは、基本的なテキストから画像への変換ツールから、ユーザーがコンポーネントをカスタマイズしたり、幅広い生成AIタスクのために構築済みのパイプラインを使用したりできるモジュール式のツールボックスへと進化しました。

フォトリアリズムとモデルサポートの進歩

🤗 Diffusers は、画質を向上させ、解剖学的なエラーなどの一般的なアーティファクトを軽減するために、高忠実度モデルを統合してきました。

  • DeepFloyd IF: ピクセルレベルで直接動作し、テキストエンコーディングに大規模言語モデルを利用するモジュール式拡散モデルで、高解像度のための3倍アップスケーリングプロセスを特徴としています。
  • Stable Diffusion XL (SDXL): Stability AIによるモデルで、Stable Diffusion 2よりも大幅に多くのパラメータを持っています。プロンプトへの忠実度のためのベースモデルと、高周波コンテンツおよび細部を処理するための専用のリファイナーモデルを採用しています。

ビデオ、3D、およびオーディオへの拡大

静止画を超えて、ライブラリはその機能を複数のモダリティに拡大してきました。

  • ビデオ生成: VideoFusionやText2Video-Zeroを含む、テキストからビデオへのパイプラインのサポート。
  • 3Dアセット生成: OpenAIのShap-Eモデルの統合。これは3D-テキストペアをエンコードし、ShapEPipelineおよびShapEImg2ImgPipelineを介して、建築、インテリアデザイン、ビデオゲーム用の資産を生成します。
  • オーディオサポート: ライブラリは、視覚的コンテンツに加えてオーディオ生成のサポートを追加しました。

推論の最適化とスピード

拡散モデルの反復的で時間のかかる性質に対処するため、🤗 Diffusers はいくつかのスピードおよびメモリの最適化を実装しました。

  • Consistency Models: OpenAIのConsistency Modelsの統合により、大幅な生成の高速化が可能になります。例えば、現代的なCPUを使用した場合、ConsistencyModelPipelineを使用して256x256の画像を0.75秒で生成できます。
  • PyTorch 2.0の統合: torch.compile()およびscaled_dot_product_attention() (SDPA) のファーストクラスのサポートにより、推論レイテンシを2倍以上削減できる可能性があります。
  • ハードウェアおよびフォーマットのサポート: このライブラリは、ONNX、Core ML、およびApple Silicon用のPyTorchデバイスであるmpsをサポートしています。
  • メモリ管理: スライスされたアテンション、フィードフォワード・チャンキング、VAEタイリング、CPU/モデルオフロードなどの技術により、コンシューマー向けGPUでの推論が可能になります。

パラメータ効率の高い微調整とトレーニング

🤗 Diffusers は、Low-Rank Adaptation (LoRA) の実装を通じて、大規模モデルの微調整の障壁を下げました。LoRAを使用すると、メモリ消費を抑えながらより高速な微調整が可能になり、簡単に共有できる軽量なウェイトを生成できます。また、このライブラリは、DreamBooth、textual inversion、カスタム拡散を含む他のパーソナライゼーション技術もサポートしています。

倫理、安全性、およびコンテンツの完全性

責任あるAIの使用を促進するために、Hugging Faceはいくつかの安全性メカニズムを導入しました。

  • Safety Checker: 推論中に不適切なコンテンツやNSFWコンテンツをフラグ立てするsafety_checkerコンポーネント。
  • 不可視のウォーターマーク: SDXLモデルには、AI生成画像と人間が作成したコンテンツを区別するのに役立つ不可視のウォーターマークが含まれており、誤情報の拡散リスクを軽減します。
  • 倫理憲章: すべての開発は、ライブラリのドキュメントに記載されている正式な倫理憲章によって導かれています。

コミュニティとエコシステムの統合

このライブラリは、オープンソースプロジェクトと商用製品の両方で広く採用されています。

オープンソースのハイライト

コミュニティの貢献により、Lama Cleaner (inpainting)、Grounded-SAM (controllable image editing)、Stable-Dreamfusion (text-to-3D) などのツールの開発が進みました。開発者は、研究用コードと比較してプロフェッショナルな実装であるとして、このライブラリを高く評価しています。ある貢献者は次のように述べています。

「🤗 Diffusersの実装は、研究室からの単なるコードであることは少なくありません... 🤗 Diffusersのおかげで、数時間以内に自分のアイデアを形にすることが非常にスムーズにできました。」

商用アプリケーション

企業は、PlaiDay (collaborative AI)、Previs One (cinematic storyboarding)、Zust.AI (product photography)、Dashtoon (visual content creation)、Virtual Staging AI (interior design)、Hexo.AI (personalized marketing) など、さまざまなサービスを動かすために🤗 Diffusersを活用しています。

主要な技術的貢献のまとめ

300人以上の貢献者が、以下を含む重要な機能をコードベースに追加しました。

  • Model Editing: モデルの暗黙的な仮定を編集するためのパイプライン。
  • LDM3D: 3D画像に特化した拡散モデル。
  • DPMSolver: 推論速度を大幅に向上させる改善。
  • Custom Diffusion: 少数の被写体画像を使用してパーソナライズされた画像を生成する技術。

Sources