Hugging Face 윤리와 사회 뉴스레터 #6: 데이터 품질의 중요성

TL;DR

Hugging Face는 고품질 데이터가 단순히 양이나 정확도에 관한 것이 아니라 “의도된 목적에 적합함”이어야 한다고 주장합니다. AI 개발 전 과정에서 데이터 품질을 우선시하는 것은 모델 성능 향상, 포괄적인 대표성 보장, 거버넌스 구현, 그리고 AI 연구에서 재현성 위기를 해결하는 데 필수적입니다.

고품질 데이터 정의

데이터 품질은 데이터가 현재 작업의 구체적인 요구에 얼마나 잘 부합하는가에 따라 결정됩니다. Hugging Face는 개발 초기 단계에서 신중한 데이터 선택이 이루어지는 “안전 설계(safety-by-design)” 접근 방식을 옹호합니다. 고품질 데이터의 주요 차원은 다음과 같습니다:

  • Relevance: 데이터는 문제에 직접 적용 가능해야 합니다. 관련 없는 데이터는 노이즈를 유발해 패턴을 가릴 수 있으며 성능 저하를 초래합니다.
  • Comprehensiveness (Completeness): 데이터셋은 현실 시나리오의 전체 범위와 다양성을 포괄해야 하며, 이를 통해 편향 및 간과된 문제를 방지합니다.
  • Timeliness (Currentness/Freshness): 데이터는 특히 급변하는 분야에서 현재 상황을 반영해야 하며, 그렇지 않으면 시스템이 비효율적이거나 위험해질 수 있습니다.
  • Mitigation of Biases: 데이터 선택은 해로운 사회적 편향, 고정관념, 혹은 소외된 그룹의 과소대표를 방지하도록 적극적으로 이루어져야 합니다.

데이터 품질이 AI 결과에 미치는 영향

데이터 품질에 투자하는 것은 효과적이고 윤리적인 AI 시스템을 구축하기 위한 기본 요건입니다. 그 혜택은 여러 핵심 영역으로 구분됩니다:

모델 성능 및 효율성

높은 데이터 품질은 모델 결과 향상과 직접적으로 연관됩니다. 세심한 정제(노이즈 제거, 부정확성 수정, 형식 표준화)는 정확도를 높입니다. 또한, 정제되고 규모가 작은 데이터셋은 더 컴팩트하고 파라미터 효율적인 모델을 가능하게 하여 학습 및 추론 시 필요한 계산 자원과 에너지를 감소시킵니다.

대표성 및 포용성

고품질 데이터는 문화적 편향을 완화하기 위해 모든 사회 집단과 언어를 대표해야 합니다. Hugging Face는 학습 데이터가 종종 지배적인 그룹을 과도하게 대표하여 왜곡된 표현과 해로운 고정관념을 초래한다는 점을 강조합니다. 이를 해결하기 위해 연구소는 “Data is Better Together” 프로젝트와 아프리카 언어를 위한 Masakhane 프로젝트와 같은 참여형 데이터 수집 및 커뮤니티 이니셔티브를 촉진합니다.

거버넌스, 책임성 및 재현성

데이터 출처, 라이선스 및 전처리 과정에 대한 투명성은 효과적인 AI 거버넌스에 필수적입니다. 데이터 출처에 대한 명확한 문서는 외부 감사와 검증을 가능하게 합니다. 과학 공동체에서는 엄격한 데이터 품질과 문서화가 “재현성 및 복제성 위기”를 해결하는 데 필요하며, 연구 결과가 다른 연구자에 의해 검토되고 확장될 수 있도록 보장합니다.

적응성 및 일반화

모델이 다양한 상황에 일반화되도록 하려면 데이터가 폭넓은 문화, 환경 및 엣지 케이스를 포괄해야 합니다. 이를 위해 지속적인 큐레이션과 피드백 루프를 구현해 실제 환경 변화에 따라 발생하는 “데이터 드리프트”와 성능 저하를 식별해야 합니다.

문서화와 합성 데이터의 역할

고품질 문서화

문서는 데이터만큼이나 중요합니다. Hugging Face는 dataset cards(데이터 진술, 데이터시트, 데이터 영양 라벨 등 다른 방법과 함께) 사용을 장려하여 데이터 출처, 구성, 처리 단계 및 원래 목적에 대한 포괄적인 개요를 제공합니다. 이는 활용성, 협업 및 투명성을 향상시킵니다.

합성 데이터 고려사항

합성 데이터는 실제 데이터에 대한 비용 효율적이고 확장 가능한 대안이지만(예: Cosmopedia 프로젝트), 위험을 동반합니다. 생성 알고리즘에 편향이 있으면 합성 데이터도 편향됩니다. 합성 데이터에 과도하게 의존하면 모델이 합성 패턴에 과도하게 맞춰져 “모델 붕괴”가 발생할 수 있습니다. Hugging Face는 합성 데이터를 신중하게 사용하고 실제 데이터와 보완하며, 생성된 콘텐츠를 워터마킹으로 명확히 표시할 것을 권고합니다.

Hugging Face의 데이터 품질 실천

Hugging Face는 프로젝트 전반에 걸쳐 높은 데이터 기준을 유지하기 위해 여러 기술 전략을 활용합니다:

  • Filtering and Deduplication: DataTrove와 같은 도구를 사용해 중복 항목과 관련 없는 노이즈를 제거하며, 이는 FineWeb-Edu 데이터셋 생성 사례에서 보여집니다.
  • Responsible Multi-modal Creation: OBELICS 데이터셋의 경우, 제작자 권리를 존중하기 위해 옵트아웃 필터링(Spawning 등 API 활용)을 구현하고, 이미지 중복을 이미지당 최대 열 번으로 제한했으며, 오픈소스 분류기를 사용해 NSFW 콘텐츠를 제외했습니다.
  • Diverse Code Selection: The Stack V2에서는 다양한 프로그래밍 언어와 프레임워크를 포괄하도록 저장소를 신중히 선택했으며, 자동 및 수동 품질 검사를 모두 활용했습니다.
  • Human Feedback Integration: 연구소는 Argilla와 같은 라벨링 도구를 사용해 이해관계자 피드백을 통합했으며, 이를 UltraFeedback 데이터셋 및 이후 Notus 모델 개선에 활용했습니다.

Sources