Hugging Face 文本到图像生成的开放偏好数据集

Data is Better Together 社区已发布一个采用 Apache 2.0 许可证的开放偏好数据集,用于文本到图像生成。此数据集提供了跨各种图像生成类别和提示复杂度的偏好对,以实现开源文本到图像模型的更好对齐和微调。

数据集组成和输入管道

open-image-preferences-v1 数据集是通过结合真实世界提示、合成增强和多模型图像生成的管道构建的。

输入提示来源和清理

提示来自 Imgsys,这是由 fal.ai 托管的生成式图像模型竞技场。由于这些提示反映了真实生活的使用情况,因此需要进行清理以删除重复内容和有毒内容。为确保数据集保持安全,团队采用了基于两个文本分类器和两个图像分类器的多模型过滤方法,随后由 Argilla 团队对每张图像进行人工审查。

合成提示增强

为了增加数据的多样性和质量,团队使用了 distilabel 管道来合成重写提示,以不同的复杂度和风格。此过程创建了三个级别的提示:

  • Default: 基础提示(例如,“一架没有任何弦的竖琴”)。
  • Stylized: 添加了风格和细节的提示(例如,添加动漫风格和粉彩背景)。
  • Quality: 侧重于光照、分辨率和纹理的高细节提示(例如,添加“逼真”和“柔和的黄金时刻光线”)。

提示类别和复杂度

提示根据 google/sdxl 和 Microsoft 的 AI 艺术提示指南等来源组织成 11 个主要类别。这些包括 Cinematic、Photographic、Anime、Manga、Digital art、Pixel art、Fantasy art、Neonpunk、3D Model、Painting、Animation 和 Illustration。数据集还包含同一提示的简化版和复杂版,以在不同细节级别下测试模型性能。

图像生成和模型比较

使用了来自不同模型族的两个高性能模型来为偏好对生成图像:stabilityai/stable-diffusion-3.5-large(SD3.5-XL)和 black-forest-labs/FLUX.1-dev(FLUX-dev)。

按类别的模型性能

对标注数据的分析表明,模型的优势因类别而异:

  • FLUX-dev: 在 3D Model、Anime 和 Manga 类别中表现更好。
  • SD3.5-XL: 在 Cinematic、Digital art、Fantasy art、Illustration、Neonpunk、Painting 和 Pixel art 类别中表现更好。
  • Ties:Photographic 和 Animation 类别出现平局。

标注者一致性

团队使用 Hugging Face 数据集 SQL 控制台发现,在测试设置中 SD3.5-XL 总体获胜的可能性略高,标注者一致性保持平衡——既不过高(表明任务太简单),也不太低(表明任务太困难)。

模型微调和验证

为了验证数据集的实用性,团队对 FLUX.1-dev 模型进行了 LoRA 微调。通过将首选样本作为期望完成并省略被拒绝的样本,微调后的模型在艺术和电影场景中表现出显著改善,而原始 FLUX-dev 模型在这些场景中之前有所不足。

社区贡献和规模

超过 250 名社区成员在两周内为该项目做出了贡献,标注了 10,000 个偏好对。考虑到标注者重叠度为 2/3,这导致总响应超过 30,000。

可用资源

Sources