허깅 페이스 오픈 선호 데이터셋 텍스트-이미지 생성
Data is Better Together 커뮤니티는 Apache 2.0 라이선스 오픈 선호 데이터셋을 텍스트-이미지 생성에 대해 출시했습니다. 이 데이터셋은 다양한 이미지 생성 카테고리와 프롬프트 복잡성에 걸쳐 선호 쌍을 제공하여 오픈소스 텍스트-이미지 모델의 더 나은 정렬과 파인튜닝을 가능하게 합니다.
데이터셋 구성 및 입력 파이프라인
open-image-preferences-v1 데이터셋은 실제 프롬프트, 합성 강화, 멀티모델 이미지 생성을 결합한 파이프라인을 사용하여 구축되었습니다.
입력 프롬프트 소싱 및 정제
프롬프트는 fal.ai가 호스팅하는 생성형 이미지 모델 아레나인 Imgsys에서 수집되었습니다. 이러한 프롬프트는 실제 생활 사용을 반영하므로 중복 및 유해 콘텐츠를 제거하기 위해 정제가 필요했습니다. 데이터셋이 안전하게 유지되도록 팀은 두 개의 텍스트 기반 및 두 개의 이미지 기반 분류기를 사용한 멀티모델 필터링 접근 방식을 구현했으며, 이어서 Argilla 팀이 각 이미지에 대한 수동 검토를 수행했습니다.
합성 프롬프트 강화
데이터 다양성과 품질을 높이기 위해 팀은 distilabel 파이프라인을 사용하여 프롬프트를 다양한 복잡도와 스타일 수준으로 합성적으로 재작성했습니다. 이 과정을 통해 세 가지 수준의 프롬프트가 생성되었습니다:
- Default: 기본 프롬프트 (예: "a harp without any strings)).
- Stylized: 스타일과 세부 사항이 강화된 프롬프트 (예: 애니메이션 스타일과 파스텔 배경 추가).
- Quality: 조명, 해상도, 텍스처에 초점을 맞춘 고세부 프롬프트 (예: "photorealistic" 및 "soft golden hour light" 추가).
프롬프트 카테고리와 복잡도
프롬프트는 google/sdxl 및 Microsoft의 AI 아트 프롬프팅 가이드와 같은 소스를 기반으로 11개의 주요 카테고리로 구성되었습니다.これ include Cinematic, Photographic, Anime, Manga, Digital art, Pixel art, Fantasy art, Neonpunk, 3D Model, Painting, Animation, 그리고 Illustration. 데이터셋은 또한 동일한 프롬프트의 간소화된 버전과 복잡한 버전을 포함하여 다양한 세부 수준에서 모델 성능을 테스트합니다.
이미지 생성 및 모델 비교
선호 쌍을 위한 이미지 생성을 위해 서로 다른 모델 가족의 두 가지 고성능 모델이 사용되었습니다: stabilityai/stable-diffusion-3.5-large (SD3.5-XL) 및 black-forest-labs/FLUX.1-dev (FLUX-dev).
카테고리별 모델 성능
주석이 달린 데이터 분석 결과, 모델의 강점은 카테고리에 따라 다름을 나타냈습니다:
- FLUX-dev: 3D Model, Anime, Manga 카테고리에서 더 나은 성능을 보였습니다.
- SD3.5-XL: Cinematic, Digital art, Fantasy art, Illustration, Neonpunk, Painting, Pixel art 카테고리에서 더 나은 성능을 보였습니다.
- Ties: Photographic 및 Animation 카테고리에서 동점이 발생했습니다.
주석자 일치도
Hugging Face datasets SQL 콘솔을 사용하여 팀은 테스트 설정에서 SD3.5-XL이 전반적으로 약간 더 승리할 가능성이 높다는 것을 발견했으며, 주석자 일치도는 균형을 유지했습니다—너무 높지 않음(작업이 너무 쉬움을 나타냄) 및 너무 낮지 않음(작업이 너무 어려움을 나타냄).
모델 파인튜닝 및 검증
데이터셋의 유용성을 검증하기 위해 팀은 FLUX.1-dev 모델에 LoRA 파인튜닝을 수행했습니다. 선호 샘플을 예상 완성도로 사용하고 거부된 샘플을 생략함으로써 파인튜닝된 모델은 원래 FLUX-dev 모델이 zuvor 부족했던 예술 및 시네마틱 시나리오에서 상당한 향상을 보였습니다.
커뮤니티 기여 및 규모
2주 미만의 기간 동안 250명 이상의 커뮤니티 멤버가 프로젝트에 기여하여 10,000개의 선호 쌍에 주석을 달았습니다. 주석자 겹침이 2/3였을 때, 이로 인해 총 30,000개 이상의 응답이 발생했습니다.
이용 가능한 리소스
- 즉시 사용 가능한 선호 데이터셋: open-image-preferences-v1-binarized
- 파인튜닝된 LoRA: open-image-preferences-v1-flux-dev-lora
- 전처리 코드: 다음에서 사용할 수 있음: data-is-better-together GitHub 저장소