人工分析文本到图像排行榜与竞技场发布

Hugging Face 推出了 人工分析文本到图像排行榜与竞技场,这是一套基于人类偏好的排名系统,旨在比较领先的开源和专有图像生成模型的质量。该计划提供了一种可扩展的方式,通过众包的人类判断来评估模型性能,填补了传统客观指标留下的空白。

基于人类偏好的方法论与 ELO 评分

人工分析文本到图像排行榜 采用众包方式大规模收集人类偏好数据。由于图像质量偏好本质上是多变的,项目使用 图像竞技场,向参与者展示一个提示词和两张生成的图像,让他们选择最能体现提示的那一张。

关键技术细节包括:

  • ELO 计算:模型排名由基于对所有人类偏好的回归得到的 ELO 分数决定,此方法类似于 Chatbot Arena 使用的方式。
  • 数据量:ELO 分数基于超过 45,000 条人类图像偏好数据。
  • 评估广度:为确保覆盖广泛的使用场景,每个模型在多种类别(包括自然、动物、艺术、人像以及多人场景)下生成超过 700 张图像。

当前市场洞察与模型表现

排行榜的早期结果显示,专有模型与开源模型之间的差距正在缩小。

专有模型 vs. 开源模型

专有模型,尤其是 MidjourneyStable Diffusion 3DALL·E 3 HD,目前在排行榜上名列前茅。然而,开源模型的竞争力日益提升;Playground AI v2.5 目前领跑开源类别,并在部分排名中超越了 OpenAI 的 DALL·E 3

领域的快速演进

图像生成技术的快速进步体现在前领头羊的衰退上。去年仍是明显领袖的 DALL·E 2 如今在竞技场中的被选中率不足 25%,并且已跌至最低模型之列。

Stable Diffusion 3 Medium 的影响

Stable Diffusion 3 目前是排行榜上的顶级竞争者。官方宣布 Stable Diffusion 3 Medium 将于 6 月 12 日开源,预计将极大惠及开源社区,可能引发社区驱动的微调版本激增,类似于 Stable Diffusion 1.5SDXL 的发展轨迹。

社区参与与工具

该项目作为 Hugging Face 的 Space 托管,提供两种主要方式让用户与数据互动:

  • 排行榜:公开的领先图像模型排名。
  • 图像竞技场:用户贡献偏好的交互界面。投票满 30 次后,用户可访问“个人排行榜”,查看基于自身偏好的个性化模型排名。

Sources