Hugging Face と Renumics Spotlight の統合によるスケーラブルなデータ検査
Hugging Face と Renumics Spotlight は統合され、1 行のコードで機械学習エンジニアがデータセットをインタラクティブに探索および可視化できるようになりました。この統合により、Hugging Face datasets ライブラリとインタラクティブな可視化ツールの間のギャップを埋めることで、重要なデータクラスターと障害モードを特定するプロセスが簡素化されます。
Hugging Face datasets ライブラリとのシームレスな統合
Spotlight は、Hugging Face datasets ライブラリの上に直接動作するように設計されており、データのコピーや前処理の必要をなくします。Apache Arrow テーブルを使用するライブラリの特性を活かし、表形式のメタデータおよび画像や音声などの非構造化データを統一された形式で保存します。
統合の主要な技術的特徴は次のとおりです:
- 遅延ロード: パフォーマンスを維持するため、Spotlight はテーブルデータをメモリにロードしてクライアントサイドの分析を効率化し、メモリ集約的な非構造化サンプル(ビデオ、オーディオ、画像)は必要に応じて遅延ロードします。
- 自動型推論: ほとんどの場合、データ型とラベルマッピングはデータセットの特徴から自動的に推論されます。あいまいなケースでは、Spotlight API を使用して
spotlight.Imageやspotlight.dtypes.CategoryDTypeなどのデータ型を手動で割り当てることができます。 - 最小限のセットアップ: ユーザーはデータセットをロードし、
spotlight.show(ds)を呼び出すことで可視化を起動できます。
モデル結果を活用したデータ検査
生の非構造化データだけでは得られる洞察が限られることが多いです。重要なデータセグメントとモデルの障害モードを明らかにするため、Spotlight は予測や埋め込みなどのモデル出力を可視化ワークフローに直接統合することをユーザーに許可します。
モデルエンリッチメントワークフロー
実務者は transformers ライブラリを使用して埋め込みと予測を計算し、その後 .map() 関数を使ってその結果を Hugging Face データセットに戻して保存できます。この「エンリッチド」データセットは、debug_classification レイアウトなどの特定の Spotlight レイアウトを使用して可視化でき、類似度マップや混同行列などのツールを提供してモデルのパフォーマンスを分析します。
データストレージの推奨事項
Hugging Face は、ラベルマッピングを維持し、ライブラリのバッチ処理機能を活用するため、予測結果を Hugging Face データセット内に直接保存することを推奨します。
データ検査ワークフローのカスタマイズ
Spotlight は、データの検査方法をカスタマイズするために GUI と Python API の両方を提供します:
- GUI カスタマイズ: ユーザーはインターフェース内で可視化レイアウトをインタラクティブに変更、保存、ロードできます。
- インスペクター ウィジェット: 時系列、オーディオ、ビデオ、テキスト、画像などのマルチモーダルデータを表現できる専用ウィジェットです。
- Python API: この API は、探索的データ分析 (EDA)、モニタリング、モデルデバッグのためのカスタムキュレーションワークフローを作成することを可能にします。さらに、データ問題ウィジェットを介して外部のデータ品質チェックスクリプトの結果を統合することもできます。
Hugging Face Hub へのデプロイ
ローカル使用に加えて、Spotlight の可視化は Hugging Face Spaces を使って Hugging Face Hub にホストできます。これにより、開発者は自分のデータセットやモデル結果を他のユーザーに紹介できます。ユーザーは既存の Spotlight サンプル スペースを複製し、HF_DATASET 環境変数を指定して自分のデータセット(特定のスプリット、サブセット、リビジョンを含む)を指すように構成できます。