Hugging Face 文字到圖像生成的開放偏好資料集
Data is Better Together 社群已發布一個採用 Apache 2.0 授權的開放偏好資料集,用於文字到圖像生成。此資料集提供了跨各種圖像生成類別和提示複雜度的偏好配對,以實現開源文字到圖像模型的更好對齊和微調。
資料集組成與輸入管道
open-image-preferences-v1 資料集是透過結合真實世界提示、合成增強和多模型圖像生成的管道構建的。
輸入提示來源與清理
提示來自 Imgsys,這是由 fal.ai 託管的生成式圖像模型競技場。由於這些提示反映了真實生活的使用,因此需要進行清理以移除重複內容和有害內容。為確保資料集的安全,團隊採用了基於兩個文字型和兩個圖像型分類器的多模型過濾方法,隨後由 Argilla 團隊對每張圖像進行人工審查。
合成提示增強
為提高資料多樣性和品質,團隊使用了 distilabel 管道來合成重寫提示,使其具有不同的複雜度和風格。此過程產生了三個層級的提示:
- Default:基本提示(例如,「沒有任何絃線的豎琴」)。
- Stylized:加入風格與細節的提示(例如,添加動漫風格和淡彩背景)。
- Quality:著重於光線、解析度和紋理的高細節提示(例如,添加「寫實」和「柔和的黃金時刻光線」)。
提示類別與複雜度
提示根據如 google/sdxl 和 Microsoft 的 AI 藝術提示指南等來源被組織成 11 個主要類別。這些包括電影感、攝影、動漫、漫畫、數位藝術、像素藝術、奇幻藝術、霓虹龐克、3D Model、繪畫、動畫和插畫。資料集還包含同一提示的簡化版和複雜版,以測試模型在不同細節程度下的表現。
圖像生成與模型比較
用於生成偏好配對圖像的兩個來自不同模型系列的高效能模型為:stabilityai/stable-diffusion-3.5-large (SD3.5-XL) 和 black-forest-labs/FLUX.1-dev (FLUX-dev)。
各類別的模型表現
對標註資料的分析顯示,模型的優勢因類別而異:
- FLUX-dev:在 3D Model、動漫和漫畫類別中表現更佳。
- SD3.5-XL:在電影感、數位藝術、奇幻藝術、插畫、霓虹龐克、繪畫和像素藝術類別中表現更佳。
- Ties:攝影和動畫類別出現平手。
標註者一致性
使用 Hugging Face datasets SQL 主控台,團隊發現在測試設置中,SD3.5-XL 稍微更有可能贏得總體勝利,且標註者協議保持平衡——既不太高(表示任務過於簡單),也不太低(表示任務過於困難)。
模型微調與驗證
為驗證資料集的實用性,團隊對 FLUX.1-dev 模型進行了 LoRA 微調。透過將偏好樣本作為預期完成並省略被拒絕的樣本,微調後的模型在原始 FLUX-dev 模型之前不足的藝術和電影感場景中顯示出顯著改善。
社群貢獻與規模
超過 250 名社群成員在兩週內為該項目做出貢獻,標註了 10,000 個偏好配對。考慮到標註者重複度為 2/3,這產生了超過 30,000 個總回應。
可用資源
- 即用型偏好資料集:open-image-preferences-v1-binarized
- 微調 LoRA:open-image-preferences-v1-flux-dev-lora
- 預處理程式碼:可見於 data-is-better-together GitHub repository.