Hugging Face Data Measurements Tool

Hugging Face 推出了 Data Measurements Tool (DMT),这是一个开源的 Python 库和无代码界面,允许数据集创建者和用户自动计算负责任数据开发的指标。该工具旨在降低数据集分析的技术门槛,使不同领域的人员能够在不需要复杂编程技能的情况下对数据集进行查询和比较。

Core Objectives and Motivation

Data Measurements Tool 的创建是为了解决 AI 开发中一个经常被忽视的空白:对“大数据”的策划和分析。作者指出,目前的规范通常涉及使用抓取的数据,而很少关注这些来源代表了什么,或者它们如何影响模型学习。

通过提供动态可视化界面,DMT 支持向更负责任的数据集创建范式的转变。这包括:

  • 从一开始就为数据集创建定义细粒度的要求。
  • 策划数据集以解决问题内容和偏见。
  • 明确数据集构建和维护中固有的价值。

该工具建立在现有的研究和提案之上,例如 "Datasheets for Datasets"、"Data Statements" 以及 Google 的 "Know Your Data" 等工具。

Technical Capabilities and Measurement Categories

DMT 通过四个主要测量类别提供可操作的洞察:

Dataset Basics

本节提供高层级的“合理性检查”以确保数据集符合预期。它包括:

  • 来自 Hugging Face Hub 的数据集描述。
  • 识别缺失值或 NaNs 的数量。

Descriptive Statistics

这些指标分析数据集的表面特征,以确定语言多样性和平衡性:

  • Vocabulary and Word Distribution: 分析开类词和闭类词。
  • Label Distribution: 关于类别平衡和不平衡的信息。
  • Instance Lengths: 计算长度的平均值、中位数、范围和分布。
  • Duplicates: 识别重复项的数量及其重复频率。

Distributional Statistics

此类测量语言模式以确定数据集是否代表自然语言行为。具体来说,它测量对 Zipf's law 的遵循程度。

  • 该工具计算一个 alpha 值;alpha 大于 2 或最小排名大于 10 通常表示分布不自然,这可能预示着存在诸如 HTML 标记之类的伪影。

Comparison Statistics

这些工具帮助用户识别数据集中的主题、偏见和关联:

  • Embedding Clusters: 该工具使用 Sentence-Transformer 模型和最大点积单链接准则来创建文本字段的分层聚类。用户可以悬停在节点上查看代表性示例,或输入文本以查找相似的叶节点聚类。
  • Normalized Pointwise Mutual Information (nPMI): 这用于识别与身份群体相关的、有问题的刻板印象和偏见,在初始版本中特别关注性别和性取向。

Current Status and Roadmap

在其 v0 alpha 版本中,该工具在 Dataset Hub 上可用的精选热门英语数据集(如 SQuAD, imdb, 和 C4)上展示了功能性。

未来的开发目标包括:

  • 扩展支持到 Hugging Face 库中更多的语言和数据集。
  • 启用对用户提供的数据集的支持以及从头开始的迭代数据集构建。
  • 添加新功能,包括允许用户为 nPMI 可视化提供自己的术语。

Sources

相关