人工分析文本到图像排行榜与竞技场发布
Hugging Face 推出了 人工分析文本到图像排行榜与竞技场,这是一套基于人类偏好的排名系统,旨在比较领先的开源和专有图像生成模型的质量。该计划提供了一种可扩展的方式,通过众包的人类判断来评估模型性能,填补了传统客观指标留下的空白。
基于人类偏好的方法论与 ELO 评分
人工分析文本到图像排行榜 采用众包方式大规模收集人类偏好数据。由于图像质量偏好本质上是多变的,项目使用 图像竞技场,向参与者展示一个提示词和两张生成的图像,让他们选择最能体现提示的那一张。
关键技术细节包括:
- ELO 计算:模型排名由基于对所有人类偏好的回归得到的 ELO 分数决定,此方法类似于 Chatbot Arena 使用的方式。
- 数据量:ELO 分数基于超过 45,000 条人类图像偏好数据。
- 评估广度:为确保覆盖广泛的使用场景,每个模型在多种类别(包括自然、动物、艺术、人像以及多人场景)下生成超过 700 张图像。
当前市场洞察与模型表现
排行榜的早期结果显示,专有模型与开源模型之间的差距正在缩小。
专有模型 vs. 开源模型
专有模型,尤其是 Midjourney、Stable Diffusion 3 与 DALL·E 3 HD,目前在排行榜上名列前茅。然而,开源模型的竞争力日益提升;Playground AI v2.5 目前领跑开源类别,并在部分排名中超越了 OpenAI 的 DALL·E 3。
领域的快速演进
图像生成技术的快速进步体现在前领头羊的衰退上。去年仍是明显领袖的 DALL·E 2 如今在竞技场中的被选中率不足 25%,并且已跌至最低模型之列。
Stable Diffusion 3 Medium 的影响
Stable Diffusion 3 目前是排行榜上的顶级竞争者。官方宣布 Stable Diffusion 3 Medium 将于 6 月 12 日开源,预计将极大惠及开源社区,可能引发社区驱动的微调版本激增,类似于 Stable Diffusion 1.5 与 SDXL 的发展轨迹。
社区参与与工具
该项目作为 Hugging Face 的 Space 托管,提供两种主要方式让用户与数据互动:
- 排行榜:公开的领先图像模型排名。
- 图像竞技场:用户贡献偏好的交互界面。投票满 30 次后,用户可访问“个人排行榜”,查看基于自身偏好的个性化模型排名。