Hugging Face 윤리와 사회 뉴스레터 #4: 텍스트-이미지 모델의 편향

Hugging Face는 텍스트-이미지 (TTI) 모델의 편향을 탐지하고 해결하기 위한 개선된 평가 방법의 critical한 필요성을 확인했습니다. 이러한 모델이 다양한 사회기술적 맥락에서 점점 더 많이 배포됨에 따라, 기존의 사회적 불평등과 문화적 고정관념을 증폭시킬 위험이 있습니다.

텍스트-이미지 시스템의 편향 원인

TTI 모델의 편향은 단일 실패의 결과가 아니라 머신러닝 파이프라인의 여러 단계에서 발생합니다. Hugging Face는 다섯 가지 주요 원인을 식별합니다:

  • 훈련 데이터: 인기 있는 멀티모달 데이터세트(예: LAION-5B, MS-COCO, VQA v2.0)는 유해한 연관성과 편향을 포함합니다. 예를 들어, Stable Bias 프로젝트는 이미지 생성에서의 다양성 부족과 정체성 그룹 고정관념의 지속을 지적했는데, 예를 들어 CEO와 관리자의 Dall-E 2 생성물이 다양성이 부족한 경우를 들 수 있습니다.
  • 사전 훈련 데이터 필터링: 데이터세트를 정제하기 위한 필터링 프로세스가 의도치 않게 편향을 증폭시킬 수 있습니다. OpenAI는 Dall-E 2의 훈련 데이터 필터링이 편향을 증가시킬 수 있다고 보고했는데, 이는 기존 데이터세트가 여성들을 성적 맥락에서 표현하려는 경향 때문일 수 있습니다.
  • 추론 (CLIP 모델): Stable Diffusion과 Dall-E 2와 같은 모델은 프롬프트 인코딩을 위해 CLIP 모델에 의존합니다. CLIP은 인종, 성별, 연령에 관한 편향이 문서화되어 있으며, 프롬프트가 충분히 지정되지 않았을 때 종종 '백인, 중년, 남성'을 기본값으로 취급합니다.
  • 잠재 공간: 모델의 잠재 공간 내부 구조는 편향을 반영할 수 있습니다. 예를 들어 Fair Diffusion과 같은 일부 작업은 성별과 같은 축을 따라 생성을 안내하여 표현을 개선하려고 탐구하지만, 잠재 공간이 출력에 어떻게 영향을 미치는지 이해하기 위해서는 더 많은 연구가 필요합니다.
  • 사후 필터링: 내장된 안전 필터는 종종 견고성이 부족합니다. Stable Diffusion 안전 필터에 대한 레드팀링 결과, 성적 콘텐츠를 효과적으로 식별하지만 폭력적, grotesque하거나 불편한 콘텐츠를 플래그 지정하는 데 자주 실패한다는 것이 밝혀졌습니다.

편향 탐지를 위한 기술적 접근법

편향을 해결하는 것은 기술 alone으로 해결할 수 없는 사회기술적 과제입니다. Hugging Face는 모델의 한계를 이해하기 위해 다음과 같은 방법들의 조합을 제안합니다:

탐색 도구

Stable Bias 프로젝트의 일환으로, Hugging Face는 모델 간 편향을 시각화하고 비교하기 위한 도구를 개발했습니다:

  • Average Diffusion Faces: 이 도구는 특정 직업(예: 'janitor')에 대한 평균 표현을 계산하여 다양한 모델(예: Stable Diffusion v1.4, v2 및 Dall-E 2)이 해당 역할을 어떻게 시각화하는지 비교합니다.
  • Face Clustering and Colorfulness Profession Explorer: 이 도구들은 사전 정의된 레이블에 의존하지 않고 생성된 데이터에서 패턴과 고정관념을 식별할 수 있게 합니다.

레드팀링

레드팀링은 프롬프트를 통해 모델에 스트레스 테스트를 가하여 취약점과 편향을 발견하는 과정을 말합니다. Hugging Face는 이 과정이 현재 임시적이며 체계적인 벤치마크나 리더보드가 부족하다고 지적합니다. 현재 레드팀링 프롬프트의 주요 오픈소스 리소스는 Anthropic의 데이터셋으로, 이는 영어 자연어 텍스트에 한정되어 있습니다.

문서화 및 평가

편향 보고를 표준화하기 위해 Hugging Face는 모델 카드, 데이터 시트, README의 사용을 옹호합니다. 모델 가중치와 함께 레드팀링 및 탐색 도구의 결과를 공유함으로써 창작자는 모델의 알려진 편향에 대한 투명성을 제공할 수 있습니다.

가치 정렬의 도전

탐지를 넘어, Hugging Face는 모델이 단순히 데이터를 모방해야 하는지 아니면 '이상적' 사회의 특정 버전을 적극적으로 촉진해야 하는지에 대한 윤리적 딜레마를 제기합니다. 이 접근법은 문화와 개인에 따라 가치가 다르기 때문에 '누구의 가치'가 프로그래밍되는지의 문제를 제기합니다.

이러한 편향의 영향은 하류 애플리케이션에 크게 의존합니다:

  • 저위험: 그래픽 디자인(예: RunwayML)과 같은 인간-인-더-루프 설정에서는 사용자가 프롬프트를 조정하여 편향을 수동으로 수정할 수 있습니다.
  • 고위험: 법의학 예술가들이 경찰 스케치를 만들기 위해 Dall-E 2를 사용하는 것과 같은 고위험 환경에서는 편향이 위험한 인종 및 사회적 고정관념을 강화할 수 있습니다.

윤리 및 사회 업데이트 추가

  • 콘텐츠 정책: Hugging Face는 핵심 가치로서 동의를 강조하도록 콘텐츠 정책을 업데이트했습니다.
  • AI 책임 정책: Hugging Face는 AI 책임에 대한 NTIA의 의견 요청에 응답을 제출했으며, 투명성, 문서화, 개방적 협력의 필요성을 강조했습니다.

Sources