Hugging Face 윤리와 사회 뉴스레터 #3: 윤리적 개방성 이니셔티브

TL;DR

Hugging Face는 윤리적 개방성 도구 모음—여섯 가지 고수준 윤리 카테고리, 커뮤니티 플래깅 기능, "Not For All Audiences" 태그, 그리고 확장된 문서—to enable safer, more inclusive open‑source machine‑learning development.


Mission: Open and Good ML

Hugging Face는 good 머신러닝(ML)을 민주화하는 사명을 제시합니다. 개방형 개발은 권력을 분산시켜 다양한 이해관계자가 다양한 가치에 따라 AI를 형성할 수 있게 합니다. 조직은 모델이 점점 더 강력해지고 다양한 콘텐츠를 생성함에 따라 개방성이 직접적인 위험 통제를 감소시킬 수 있음을 인정합니다. 따라서 Hugging Face는 소수 집단에 불균형적으로 영향을 미치는 해악을 완화하기 위해 강력한 모더레이션, 편향 탐지 및 문서화의 필요성을 강조합니다.

Ethical Categories – Six High‑Level Tags

사용자가 윤리적으로 지향된 ML 작업을 찾고 기여할 수 있도록, Hugging Face는 커뮤니티가 제출한 Spaces 분석을 기반으로 여섯 가지 전문 용어가 없는 카테고리를 정의했습니다:

  • Rigorous – 편향 및 공정성 감사, 프라이버시 보호, 명확한 제한 공개와 같은 모범 사례를 강조합니다.
  • Consentful – 기술의 영향을 받는 개인의 자기결정을 지원합니다 (see Consentful Tech).
  • Socially Conscious – 사회적, 환경적, 과학적 목표를 촉진하는 프로젝트를 강조합니다.
  • Sustainable – ML의 생태 발자국을 줄이는 기술에 초점을 맞춥니다.
  • Inclusive – ML 시스템을 구축하고 혜택을 받는 사람들의 범위를 확대합니다.
  • Inquisitive – 불평등과 권력 구조를 밝히고 커뮤니티가 기술과의 관계를 재고하도록 촉구합니다.

이 태그들은 관련 저장소에 표시되며 커뮤니티 입력에 따라 진화할 것입니다. 자세한 내용은 https://huggingface.co/ethics 에서 확인하세요.

Safeguards – Tools and Processes for Risk Mitigation

Hugging Face는 "전부 혹은 전무" 접근 방식을 거부합니다. 대신, ML 아티팩트가 공유되고 재사용되는 방식을 제어할 수 있는 여러 레버를 제공합니다:

  1. Flagging Feature – 사용자는 모델, 데이터셋, Spaces 또는 토론이 콘텐츠 가이드라인을 위반할 경우 플래그를 달 수 있습니다. 플래그 아이콘은 각 저장소 페이지에 표시되며, 설명 필드를 통해 신고자는 상황을 제공할 수 있습니다.
  2. Community Monitoring – 모더레이터가 토론 게시판을 감독하여 플랫폼 행동 강령을 시행합니다.
  3. Enhanced Model Cards – 인기 모델은 사회적 영향, 편향, 의도된 사용 및 범위 외 시나리오를 다루는 상세 문서를 받습니다.
  4. Audience‑Guiding Tagsnot-for-all-audiences 태그는 경고 팝업을 트리거하여 사용자가 콘텐츠를 인지한 후 선택적으로 열람할 수 있게 합니다.
  5. Responsible AI Licenses (RAIL) – Hugging Face는 BLOOM 및 BigCode와 같은 모델에 대해 Open Responsible AI Licenses를 홍보하여 법적 조건을 윤리적 의도와 맞춥니다.
  6. Misuse Research – 진행 중인 분석(예: arXiv:2302.04844)은 남용 가능성이 높은 모델 및 데이터셋을 식별합니다.

Flagging Workflow

  • 저장소 페이지에서 플래그 아이콘을 클릭합니다.
  • 문제에 대한 자세한 설명을 제공합니다.
  • 신고는 저장소의 커뮤니티 탭에서 대화를 열어 신고자, 저장소 소유자 및 Hugging Face 직원 간의 투명한 대화를 가능하게 합니다.

Response Options for High‑Risk Flags

  • 트렌드 피드에서 가시성을 낮춥니다.
  • 접근 제한을 위한 게이팅을 활성화합니다(모델 및 데이터셋 게이팅 문서 참조).
  • 저장소를 비공개로 전환합니다.
  • 접근을 완전히 차단합니다.

Adding the “Not For All Audiences” Tag

  1. 모델 또는 데이터셋 카드를 편집합니다.
  2. tags 필드에 not-for-all-audiences를 추가합니다.
  3. 풀 리퀘스트를 제출합니다; 병합되면 태그가 저장소 페이지에 표시됩니다.
  4. 사용자는 경고 팝업을 보고 콘텐츠를 열람할 옵션을 선택할 수 있으며, 선호도는 Content Preferences에서 조정할 수 있습니다.

Community Call to Action

Hugging Face는 안전장치를 연구하는 연구자들이 Hub에 도구를 공유하도록 초대합니다. 최근 커뮤니티 기여에는 다음이 포함됩니다:

  • LLM Watermarking – 대형 언어 모델을 위한 워터마킹 데모 (John Kirchenbauer et al., arXiv:2301.10226).
  • Model Card Generation Tool – 포괄적인 모델 카드를 손쉽게 만들 수 있는 인터랙티브 도구.
  • Photoguard – 이미지 조작 탐지를 위한 안전장치.

이 예시들은 오픈소스 기여가 안전성과 투명성을 직접적으로 향상시킬 수 있음을 보여줍니다.


이 뉴스레터는 Irene Solaiman, Giada Pistilli, Nima Boscarino, Yacine Jernite, Elizabeth Allendorf, 그리고 Margaret Mitchell가 Ethics and Society 팀을 대표해 작성했습니다.

Sources