인공 분석 텍스트-이미지 리더보드 및 아레나 출시

Hugging Face는 선도적인 오픈소스 및 독점 이미지 생성 모델의 품질을 비교하도록 설계된 인간 선호 기반 순위 시스템인 인공 분석 텍스트-이미지 리더보드와 아레나를 도입했습니다. 이 이니셔티브는 크라우드소싱된 인간 판단을 사용해 모델 성능을 평가하는 확장 가능한 방법을 제공하며, 기존의 객관적 지표가 남긴 공백을 메웁니다.

인간 선호 방법론 및 ELO 점수

인공 분석 텍스트-이미지 리더보드는 대규모로 인간 선호 데이터를 수집하기 위해 크라우드소싱 방식을 활용합니다. 이미지 품질 선호는 본질적으로 변동성이 있기 때문에, 프로젝트는 이미지 아레나를 사용하여 참가자에게 프롬프트와 두 개의 생성된 이미지를 제시하고, 프롬프트를 가장 잘 반영하는 이미지를 선택하도록 합니다.

  • ELO 계산: 모델 순위는 모든 인간 선호에 대한 회귀에서 도출된 ELO 점수에 의해 결정되며, 이는 Chatbot Arena에서 사용된 방법과 유사합니다.
  • 데이터 양: ELO 점수는 45,000개 이상의 인간 이미지 선호 데이터를 기반으로 합니다.
  • 평가 범위: 다양한 사용 사례를 보장하기 위해, 각 모델에 대해 자연, 동물, 예술, 인간 초상, 사람 그룹 등 다양한 카테고리에서 700개 이상의 이미지를 생성합니다.

현재 시장 통찰 및 모델 성능

리더보드의 초기 결과는 독점 모델과 오픈소스 이미지 생성 모델 간의 격차가 좁혀지고 있음을 강조합니다.

독점 vs. 오픈소스

독점 모델, 특히 Midjourney, Stable Diffusion 3, DALL·E 3 HD가 현재 리더보드에서 선두를 차지하고 있습니다. 그러나 오픈소스 모델도 점점 경쟁력을 갖추고 있습니다; Playground AI v2.5가 현재 오픈소스 카테고리를 선도하며 일부 순위에서 OpenAI의 DALL·E 3를 능가합니다.

분야의 급속한 진화

이미지 생성 분야의 빠른 발전은 이전 리더들의 감소에서 확인됩니다. 1년 전 명확한 리더였던 DALL·E 2는 이제 아레나에서 선택되는 비율이 25% 미만이며, 최하위 모델 중 하나로 순위에 올랐습니다.

Stable Diffusion 3 Medium의 영향

Stable Diffusion 3은 현재 리더보드에서 상위 경쟁자입니다. Stable Diffusion 3 Medium이 6월 12일에 오픈소스로 공개될 것이라는 발표는 오픈소스 커뮤니티에 큰 혜택을 줄 것으로 예상되며, Stable Diffusion 1.5와 SDXL의 궤적과 유사하게 커뮤니티 주도의 파인튜닝 버전이 급증할 가능성이 있습니다.

커뮤니티 참여 및 도구

이 프로젝트는 Hugging Face의 Space로 호스팅되며, 사용자가 데이터와 상호작용할 수 있는 두 가지 주요 방법을 제공합니다:

  • 리더보드: 주요 이미지 모델들의 공개 순위.
  • 이미지 아레나: 사용자가 선호도를 기여하는 참여형 인터페이스입니다. 30표를 투표하면 사용자는 "개인 리더보드"에 접근하여 자신의 특정 선호에 기반한 맞춤형 모델 순위를 확인할 수 있습니다.

Sources