capitalone/DataProfiler
What's in your data? Extract schema, statistics and entities from datasets
解決する課題
DataProfilerは、データセット内の機密情報の分析、モニタリング、検出のプロセスを簡素化します。さまざまなファイル形式にわたって、データスキーマの特定、統計量の計算、個人識別情報(PII)または非公開情報(NPI)の認識という退屈な作業を自動化します。
仕組み
このライブラリは、Dataクラスを使用して、ファイル(CSV、Parquet、JSON、Avroなど)を自動的に検出してPandas DataFrameに読み込みます。次に、Profilerがこのデータを分析してプロファイル(グローバル統計量(例:行数、欠損率)と列レベルの統計量(例:平均、分散、ユニーク数)を含む辞書)を生成します。機密データの検出には、学習済みディープラーニングモデルを使用して、メールアドレス、クレジットカード番号、SSNなどのエンティティにラベルを付けます。ユーザーは、新しいエンティティやカスタム認識パイプラインを使用してモデルを拡張することもできます。
対象者
品質やコンプライアンスのためにデータセットを迅速に監査する必要があるデータサイエンティスト、データエンジニア、セキュリティアナリスト、特にプライバシーの理由で機密データを特定する必要がある方向けに設計されています。
ハイライト
- 自動機密データ検出: 学習済みディープラーニングモデルを使用してPII/NPIエンティティを特定します。
- 幅広いフォーマット対応: CSV、TSV、JSON、Avro、Parquet、テキストファイル、およびURLに対応しています。
- 包括的な統計情報: ギニ不純度や相関行列を含む、詳細なグローバルおよび列レベルのメトリクスを提供します。
- 柔軟なプロファイリング: 構造化データ、非構造化データ、およびグラフベースのデータプロファイリングをサポートします。
- スケーラブルなワークフロー: 新しいデータバッチで既存のプロファイルを更新したり、加算演算子を使用して複数のプロファイルをマージしたりできます。
関連
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト