Hugging Face テキスト・トゥ・イメージ生成のためのオープンプリファレンスデータセット

Data is Better Together コミュニティは、Apache 2.0 ライセンスのオープンプリファレンスデータセットをテキスト・トゥ・イメージ生成向けにリリースしました。このデータセットは、さまざまな画像生成カテゴリとプロンプトの複雑さにわたるプリファレンスペアを提供し、オープンソースのテキスト・トゥ・イメージモデルのアライメントとファインチューニングを向上させることを可能にします。

データセット構成と入力パイプライン

open-image-preferences-v1 データセットは、実際のプロンプト、合成強化、マルチモデル画像生成を組み合わせたパイプラインを使用して構築されました。

入力プロンプトの収集とクリーニング

プロンプトは、fal.ai がホストする生成画像モデルアリーナである Imgsys から収集されました。これらのプロンプトは実際の使用状況を反映しているため、重複と有害なコンテンツを削除するためにクリーニングが必要でした。データセットの安全性を確保するため、チームはテキストベースの分類器 2 つと画像ベースの分類器 2 つを使用したマルチモデルフィルタリングアプローチを実装し、続いて Argilla チームによるすべての画像の手動レビューを行いました。

合成プロンプトの強化

データの多様性と品質を高めるため、チームは distilabel パイプラインを使用してプロンプトを異なる複雑さとスタイルに合成的に書き換えました。このプロセスにより、3 つのプロンプトの階層が作成されました:

  • Default: 基本的なプロンプト(例:"a harp without any strings")。
  • Stylized: スタイルと詳細が追加されたプロンプト(例:アニメスタイルとパステル背景の追加)。
  • Quality: 照明、解像度、テクスチャに焦点を当てた高詳細プロンプト(例:"photorealistic" と "soft golden hour light" の追加)。

プロンプトのカテゴリと複雑さ

プロンプトは、google/sdxl や Microsoft の AI アートプロンプティングガイドなどのソースに基づいて、11 の主要カテゴリに整理されました。これには Cinematic, Photographic, Anime, Manga, Digital art, Pixel art, Fantasy art, Neonpunk, 3D Model, Painting, Animation, Illustration が含まれます。データセットには、詳細レベルの異なるモデルのパフォーマンスをテストするために、同じプロンプトの簡略版と複雑版も含まれています。

画像生成とモデル比較

異なるモデルファミリからの 2 つの高性能モデルが、プリファレンスペアの画像生成に使用されました:stabilityai/stable-diffusion-3.5-large (SD3.5-XL) と black-forest-labs/FLUX.1-dev (FLUX-dev)。

カテゴリごとのモデルパフォーマンス

注釈付きデータの分析から、モデルの強みがカテゴリごとに異なることが明らかになりました:

  • FLUX-dev: 3D Model, Anime, Manga カテゴリで優れたパフォーマンスを示しました。
  • SD3.5-XL: Cinematic, Digital art, Fantasy art, Illustration, Neonpunk, Painting, Pixel art カテゴリで優れたパフォーマンスを示しました。
  • タイ: Photographic と Animation カテゴリではタイとなりました。

アノテーターの一致

Hugging Face datasets SQL コンソールを使用して、チームはテストセットアップにおいて SD3.5-XL が全体的にわずかに勝ちやすいことを発見しました。アノテーターの合意はバランスが取れており、タスクが слишком簡単(一致が過度に高い)または слишком難しい(一致が過度に低い)ことを示していません。

モデルのファインチューニングと検証

データセットの有用性を検証するため、チームは FLUX.1-dev モデルの LoRA ファインチューニングを実行しました。望ましいサンプルを期待される補完として使用し、却下されたサンプルを省略することで、ファインチューニングされたモデルは、元の FLUX-dev モデルが以前不足していたアートとシネマティックシナリオで顕著な改善を示しました。

コミュニティへの貢献と規模

2週間未満で 250 名以上のコミュニティメンバーがプロジェクトに貢献し、10,000 ペアのプリファレンスをアノテートしました。アノテーターのオーバーラップが 2/3 であるため、これにより合計で 30,000 以上のレスポンスが得られました。

利用可能なリソース

Sources