Hugging Face Data Measurements Tool
Hugging Face 推出了 Data Measurements Tool (DMT),這是一個開源的 Python 函式庫與無程式碼介面,讓資料集建立者與使用者能夠自動計算用於負責任資料開發的指標。該工具旨在降低資料集分析的技術門檻,使不同領域的人士都能在不需要複雜編碼技能的情況下,對資料集進行審查與比較。
Core Objectives and Motivation
Data Measurements Tool 的建立是為了填補 AI 開發中經常被忽視的「大數據」策劃與分析缺口。作者指出,目前的規範通常涉及使用抓取的資料,而極少關注來源代表什麼,或是這些來源如何影響模型的學習。
透過提供動態視覺化介面,DMT 支持向更負責任的資料集建立範式轉移。這包括:
- 從一開始就為資料集建立定義細粒度的需求。
- 策劃資料集以解決有問題的內容與偏見。
- 明確化資料集建構與維護中固有的價值觀。
該工具建立在現有的研究與提案之上,例如「Datasheets for Datasets」、「Data Statements」以及 Google 的「Know Your Data」等工具。
Technical Capabilities and Measurement Categories
DMT 透過四個主要的測量類別提供具備行動力的洞察:
Dataset Basics
這個部分提供高層次的「健全性檢查」(sanity checks) 以確保資料集符合預期。它包括:
- 來自 Hugging Face Hub 的資料集描述。
- 識別缺失值或 NaNs 的數量。
Descriptive Statistics
這些指標分析資料集的表面特性,以確定語言多樣性與平衡性:
- Vocabulary and Word Distribution: 分析開類別與閉類別單字。
- Label Distribution: 關於類別平衡與不平衡的資訊。
- Instance Lengths: 計算長度的平均值、中位數、範圍與分佈。
- Duplicates: 識別重複項的數量及其重複頻率。
Distributional Statistics
此類別測量語言模式,以確定資料集是否代表自然語言行為。具體而言,它測量對 Zipf's law 的遵循程度。
- 該工具會計算一個 alpha 值;若 alpha 大於 2 或最小排名 (minimum rank) 大於 10,通常表示分佈不自然,這可能預示著存在如 HTML 標記等人工痕跡。
Comparison Statistics
這些工具幫助使用者識別資料集中的主題、偏見與關聯性:
- Embedding Clusters: 該工具使用 Sentence-Transformer 模型與最大點積單連結準則 (maximum dot product single-linkage criterion) 來建立文字欄位的層級聚類。使用者可以將滑鼠懸停在節點上以查看代表性範例,或輸入文字以尋找相似的葉節點聚類。
- Normalized Pointwise Mutual Information (nPMI): 這用於識別與身分群體相關的有問題的刻板印象與偏見,在初始版本中特別關注性別與性傾向。
Current Status and Roadmap
截至其 v0 alpha 版本,該工具已在 Dataset Hub 上可用的精選熱門英文資料集(例如 SQuAD, imdb, 和 C4)上展示了功能性。
未來的開發目標包括:
- 擴展對 Hugging Face 函式庫中更多語言與資料集的支援。
- 啟用對使用者提供之資料集的支援,以及從零開始的迭代式資料集建立。
- 新增功能,包括允許使用者為 nPMI 視覺化提供自己的術語。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch