Hugging Face 윤리와 사회 뉴스레터 #2: 머신러닝 편향 다루기

Hugging Face는 머신러닝 편향을 다루는 포괄적인 가이드를 발표했으며, 편향은 단일 기술적 개입만으로 해결될 수 없는 복합적인 사회기술적 문제임을 강조합니다. 핵심 요점은 머신 편향을 차별 기반 피해의 위험 요인으로 보고, 완화에는 ML 개발 주기의 모든 단계에 걸친 공동 책임이 필요하다는 것입니다.

머신 편향: 사회적 해악의 위험 요인

머신 편향—시스템이 부정적인 고정관념을 인코딩하거나 인구 집단 간에 차별적인 성능을 보이는 메커니즘—은 기존 사회적 불평등을 증폭시킬 수 있습니다. Hugging Face는 자동화와 규모가 이러한 문제를 악화시키는 네 가지 주요 방식을 제시합니다:

  1. 행동 고정: 기술은 사회적 편향을 시간에 고정시켜 사회적 진보를 방해합니다.
  2. 해로운 행동 전파: 편향은 훈련 데이터의 원래 맥락을 넘어 확산될 수 있습니다.
  3. 불평등 증폭: 시스템은 예측 시 고정관념적 연관에 과도하게 집중할 수 있습니다.
  4. 구제 수단 제거: 편향은 "블랙박스" 시스템 내부에 숨겨져 영향을 받는 개인이 정의를 구하기 어렵게 만듭니다.

컨텍스트의 역할

편향은 모델의 정적인 속성이 아니라 배포 컨텍스트에 따라 달라집니다. 모델 수준의 머신 편향은 한 응용에서는 무관할 수 있지만 다른 응용에서는 재앙이 될 수 있습니다. 예를 들어, 전문적인 환경을 밝은 피부톤과 연관 짓는 텍스트‑이미지 모델은 다음과 같은 위험 요인을 가집니다:

  • 모델이 사람을 명시적으로 배제하는 배경에 사용될 경우 무관합니다.
  • 위키피디아의 스톡 이미지에 사용될 경우 고정관념을 증폭합니다.
  • 경찰 부서가 용의자 스케치를 생성하는 데 사용할 경우 직접적인 차별을 초래합니다.

ML 개발 주기 전반에 걸친 편향 완화

편향은 어디에나 존재하고 복잡하기 때문에, Hugging Face는 개발의 세 핵심 단계에 초점을 맞춘 다각적 접근을 권장합니다.

1. 작업 정의

편향의 영향은 종종 작업이 어떻게 정의되고 어떤 목표가 최적화되는지에서 시작됩니다. 예를 들어, 참여도만을 최적화하는 추천 시스템은 미디어 다양성을 감소시키고 과거 고정관념을 고정시킬 수 있습니다.

작업 정의를 위한 권고사항:

  • ML 도입 전에 해당 분야에서 보고된 편향 사례를 조사합니다.
  • 사용 사례에 특화된 위험 인구통계 범주를 식별합니다.
  • 최적화 목표가 편향을 강화하는지 검토하고, 다양성과 장기적인 긍정적 영향을 우선시하는 대안을 탐색합니다.

2. 데이터셋 정제

데이터셋은 종종 인간의 고정관념을 인코딩하고 대표성이 부족해 차별적인 성능을 초래합니다. Hugging Face는 개발자가 데이터의 출처, 포함된 사람들, 정제 과정을 반성하도록 제안합니다.

데이터셋 분석을 위한 주요 도구:

  • Dataset Cards: 사회적 영향 및 편향에 대한 통찰을 공유하는 문서화 프레임워크.
  • Disaggregators Library: 대표성 피해를 최소화하기 위해 데이터셋 구성을 정량화하는 도구.
  • Data Measurements Tool: 정규화된 점별 상호정보(nPMI)를 사용해 용어 간 고정관념적 연관(예: 성별 대명사)을 드러냅니다.

3. 모델 훈련 및 선택

모델의 편향을 문서화하고 측정하면 개발자는 특정 응용에 가장 안전한 모델을 선택하거나 새로운 모델을 훈련시킬 때 지침으로 활용할 수 있습니다.

평가 및 시각화 전략:

  • Model Cards: 윤리적 고려사항 및 분할 평가를 위한 보고 프레임워크.
  • Output Visualization: 생성 모델의 경우 형용사와 직업별 출력을 비교해 재현된 고정관념을 식별합니다. 분류 모델의 경우 SEAL app과 같은 도구가 유사한 오류를 그룹화해 차별적 성능을 초래하는 실패 모드를 파악합니다.
  • Quantitative Benchmarks: BOLD, HONEST, WinoBias와 같은 벤치마크를 활용해 언어 모델의 특정 행동을 평가합니다.
  • Evaluation on the Hub: 개별 개발자에게는 계산 비용이 과도할 수 있는 대형 모델에 대한 평가를 실행하는 도구.

Hugging Face 편향 완화 도구 요약

단계 추천 도구
작업 정의 ML Tasks directory, Task Exploration tool
데이터셋 정제 Dataset Cards, Disaggregators library, Data Measurements Tool
모델 개발 Model Cards, SEAL app, DiffusionBiasExplorer, Evaluation on the Hub, Bias Score Cards

Sources