Hugging Face データ測定ツール
Hugging Faceは、Data Measurements Tool (DMT)を導入しました。これは、責任あるデータ開発のためのメトリクスを自動的に計算できるオープンソースのPythonライブラリおよびノーコードインターフェースです。このツールは、データセット分析の技術的ハードルを下げ、複雑なコーディングスキルを必要とせずに、さまざまな分野の人々がデータセットを検証および比較できるようにすることを目的としています。
コア目的と動機
Data Measurements Toolは、AI開発における「ビッグデータ」のキュレーションと分析がしばしば見落とされるギャップに対処するために作成されました。著者たちは、現在の規範では、ソースが何を表しているかやそれがモデル学習にどのように影響するかに最小限の注意を払いながら、スクレイピングされたデータを使用することが頻繁にあると指摘しています。
動的な可視化インターフェースを提供することにより、DMTはより責任あるデータセット作成へのパラダイムシフトをサポートします。これには以下が含まれます:
- データセット作成の開始時に細かい要件を定義する。
- 問題のあるコンテンツとバイアスに対処するためにデータセットをキュレートする。
- データセットの構築とメンテナンスに固有の値を明示する。
このツールは、「Datasheets for Datasets」、「Data Statements」、およびGoogleの「Know Your Data」などのツールなど、既存の研究と提案に基づいて構築されています。
テクニカル機能と測定カテゴリ
DMTは、4つの主要な測定カテゴリを通じて実用的な洞察を提供します:
データセットの基本
このセクションでは、データセットが期待通りであることを確認するための高レベルの「サニティチェック」を提供します。これには以下が含まれます:
- Hugging Face Hubから取得されたデータセットの説明。
- 欠損値またはNaNの数の特定。
記述統計
これらのメトリクスは、データセットの表面的特性を分析して言語の多様性とバランスを決定します:
- 語彙と語彙分布: 開放クラス語と閉鎖クラス語の分析。
- ラベル分布: クラスのバランスと不均衡に関する情報。
- インスタンス長: 長さの平均、中央値、範囲、および分布の計算。
- 重複: 重複の数とその繰り返し頻度の特定。
分布統計
このカテゴリは、データセットが自然言語の振る舞いを表しているかどうかを判断するために言語パターンを測定します。具体的には、Zipfの法則への適合度を測定します。
- ツールはアルファ値を計算します;アルファが2より大きいか、最小ランクが10より大きい場合は、通常、HTMLマークアップなどのアーティファクトの存在を示す不自然な分布を示します。
比較統計
これらのツールは、データセット内のトピック、バイアス、および関連付けを特定するのに役立ちます:
- 埋め込みクラスター: ツールはSentence-Transformerモデルと最大ドット積シングルリンク基準を使用して、テキストフィールドの階層的クラスタリングを作成します。ユーザーはノードにホバーして代表的な例を見たり、テキストを入力して類似の葉クラスターを見つけることができます。
- 正規化ポイントワイズ相互情報量(nPMI): これは、アイデンティティグループに関連する問題のあるステレオタイプと偏見を特定するために使用され、初回リリースでは特に性別と性的指向に焦点を当てています。
現在の状況とロードマップ
v0アルファリリース時点では、ツールはDataset Hubで利用可能な人気のある英語データセット(SQuAD、imdb、C4など)の選択に対して機能を示しています。
今後の開発目標には以下が含まれます:
- Hugging Faceライブラリ内のより多くの言語とデータセットへのサポートの拡張。
- ユーザー提供のデータセットおよびスクラッチからの反復的なデータセット構築のサポートを有効にする。
- ユーザーがnPMIの可視化のために独自の用語を提供できる機能など、新しい機能の追加。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch