Hugging Face Data Measurements Tool

Hugging Face는 데이터셋 제작자와 사용자가 책임감 있는 데이터 개발을 위한 지표를 자동으로 계산할 수 있도록 하는 오픈 소스 Python 라이브러리이자 노코드(no-code) 인터페이스인 Data Measurements Tool (DMT)를 출시했습니다. 이 도구는 데이터셋 분석의 기술적 장벽을 낮추어 다양한 분야의 사람들이 복잡한 코딩 기술 없이도 데이터셋을 조사하고 비교할 수 있도록 하는 것을 목표로 합니다.

Core Objectives and Motivation

Data Measurements Tool은 AI 개발에서 "big data"의 큐레이션과 분석이 종종 간과되는 격차를 해결하기 위해 만들어졌습니다. 저자들은 현재의 규범이 소스의 의미나 모델 학습에 미치는 영향에 대해 최소한의 주의만 기울인 채 스크래핑된 데이터를 사용하는 경우가 많다고 언급합니다.

동적인 시각화 인터페이스를 제공함으로써, DMT는 더욱 책임감 있는 데이터셋 생성으로의 패러다임 전환을 지원합니다. 여기에는 다음이 포함됩니다:

  • 데이터셋 생성을 위한 세밀한 요구사항을 처음부터 정의하기.
  • 문제적 콘텐츠와 편향을 해결하기 위해 데이터셋을 큐레이션하기.
  • 데이터셋 구축 및 유지 관리 과정에 내재된 가치를 명시적으로 드러내기.

이 도구는 "Datasheets for Datasets," "Data Statements," 및 Google의 "Know Your Data"와 같은 기존 연구 및 제안을 기반으로 구축되었습니다.

Technical Capabilities and Measurement Categories

DMT는 네 가지 주요 측정 범주를 통해 실행 가능한 통찰력을 제공합니다:

Dataset Basics

이 섹션은 데이터셋이 예상대로인지 확인하기 위한 고수준의 "sanity checks"를 제공합니다. 여기에는 다음이 포함됩니다:

  • Hugging Face Hub에서 가져온 데이터셋 설명.
  • 누락된 값 또는 NaNs의 개수 식별.

Descriptive Statistics

이 지표들은 데이터셋의 표면적 특성을 분석하여 언어적 다양성과 균형을 결정합니다:

  • Vocabulary and Word Distribution: open- and closed-class words에 대한 분석.
  • Label Distribution: 클래스 균형 및 불균형에 대한 정보.
  • Instance Lengths: 평균, 중앙값, 범위 및 길이 분포의 계산.
  • Duplicates: 중복 항목의 개수와 반복 빈도 식별.

Distributional Statistics

이 범주는 언어 패턴을을 분석하여 데이터셋이 자연어 동작을 나타내는지 판단합니다. 구체적으로, Zipf's law 준수 여부를 측정합니다.

  • 도구는 alpha 값을 계산합니다. alpha 값이 2보다 크거나 최소 순위(minimum rank)가 10보다 큰 경우 일반적으로 부자연스러운 분포를 나타내며, 이는 HTML markup과 같은 아티팩트의 존재를 나타낼 수 있습니다.

Comparison Statistics

이 도구들은 사용자가 데이터셋 내의 주제, 편향, 연관성을 식별하는 데 도움을 줍니다:

  • Embedding Clusters: 도구는 Sentence-Transformer 모델과 maximum dot product single-linkage criterion을 사용하여 텍스트 필드의 계층적 클러스터링을 생성합니다. 사용자는 노드에 마우스를 올리면 대표적인 예시를를 볼 수 있거나 텍스트를 입력하여 유사한 리프 클러스터(leaf clusters)를 찾을 수 있습니다.
  • Normalized Pointwise Mutual Information (nPMI): 이는 정체성 그룹과 관련된 문제적 스테레오타입과 편견을 식별하는 데 사용되며, 초기 출시 버전에서는 특히 성별과 성적 지향에 초점을 맞춥니다.

Current Status and Roadmap

v0 alpha 버전 출시 기준으로, 이 도구는 Dataset Hub에서 사용 가능한 인기 있는 영어 데이터셋(SQuAD, imdb, C4 등)에 대해 기능을 데모합니다.

향후 개발 목표는 다음과 같습니다:

  • Hugging Face 라이브러리 내의 더 많은 언어와 데이터셋에 대한 지원을 확장하기.
  • 사용자가 제공하는 데이터셋 및 처음부터 반복적으로 데이터셋을 구축하는 기능을 지원하기.
  • nPMI 시각화에 대해 사용자가 직접 용어를 제공할 수 있는 기능을 포함한 새로운 기능을 추가하기.

Sources

관련