人工分析文字轉圖排行榜與競技場發布
Artificial Analysis Text to Image Leaderboard and Arena Launch
Hugging Face has launched the Artificial Analysis Text to Image Leaderboard and Arena, using human preference data from over 45,000 votes to rank open-source and proprietary image generation models.
Artificial Analysis Text to Image Leaderboard and Arena Launch
Hugging Face 推出了人工分析文字轉圖排行榜與競技場,這是一個基於人類偏好的排名系統,旨在比較領先的開源與專有圖像生成模型的品質。此計畫提供了一種可擴展的方式,透過眾包的人類判斷來評估模型表現,填補了傳統客觀指標留下的空白。
人類偏好方法論與 ELO 計分
人工分析文字轉圖排行榜採用眾包方式大規模收集人類偏好資料。由於圖像品質偏好本質上具有變異性,該專案使用圖像競技場,向參與者展示一個提示詞與兩張生成的圖像,讓他們選擇最能符合提示的那一張。
- ELO 計算:模型排名由根據所有人類偏好回歸得出的 ELO 分數決定,這種方法類似於 Chatbot Arena 使用的方式。
- 資料量:ELO 分數是基於超過 45,000 筆人類圖像偏好得出的。
- 評估廣度:為確保涵蓋廣泛的使用情境,為每個模型在多樣化類別(包括自然、動物、藝術、人像與群體)生成超過 700 張圖像。
當前市場洞察與模型表現
排行榜的早期結果顯示,專有與開源圖像生成模型之間的差距正在縮小。
專有 vs. 開源
專有模型,特別是 Midjourney、Stable Diffusion 3 與 DALL·E 3 HD,目前在排行榜上領先。然而,開源模型的競爭力日益提升;Playground AI v2.5 目前領先開源類別,且在某些排名中超過 OpenAI 的 DALL·E 3。
領域的快速演進
圖像生成的快速進步可從先前領導者的衰退看出。DALL·E 2 在一年前仍是明顯的領導者,現在在競技場中的被選擇率低於 25%,且排名位於最底層模型之列。
Stable Diffusion 3 Medium 的影響
Stable Diffusion 3 目前是排行榜上的頂尖競爭者。宣布 Stable Diffusion 3 Medium 將於 6 月 12 日開源,預計將大幅惠及開源社群,可能引發社群驅動的微調版本激增,類似於 Stable Diffusion 1.5 與 SDXL 的發展軌跡。
社群參與與工具
此專案以 Hugging Face 的 Space 形式託管,提供使用者與資料互動的兩種主要方式:
- 排行榜:領先圖像模型的公開排名。
- 圖像競技場:使用者貢獻偏好的參與式介面。投票達 30 次後,使用者可取得「個人排行榜」,查看根據其特定偏好所產生的個人化模型排名。