capitalone/DataProfiler

What's in your data? Extract schema, statistics and entities from datasets

解決的問題

DataProfiler 簡化了分析、監控和檢測數據集內敏感資訊的過程。它將識別數據架構、計算統計數據以及識別各種檔案格式中的個人識別資訊 (PII) 或非公開資訊 (NPI) 等繁瑣任務自動化。

工作原理

該函式庫使用 Data 類別自動檢測並將檔案(如 CSV、Parquet、JSON 和 Avro)載入到 Pandas DataFrame 中。接著,Profiler 分析這些數據以生成剖析檔——一個包含全域統計數據(例如列數、空值率)和欄位級統計數據(例如平均值、方差、唯一計數)的字典。對於敏感數據檢測,它採用預訓練的深度學習模型來標記電子郵件地址、信用卡號碼和 SSN 等實體。使用者也可以透過新實體或自定義識別流水線來擴展模型。

適用對象

專為需要快速審核數據集品質或合規性的數據科學家、數據工程師和安全分析師設計,特別是那些出於隱私原因需要識別敏感數據的使用者。

亮點

  • 自動化敏感數據檢測:使用預訓練的深度學習模型來識別 PII/NPI 實體。
  • 廣泛的格式支援:相容 CSV、TSV、JSON、Avro、Parquet、文字檔案和 URL。
  • 全面的統計數據:提供詳細的全域和欄位級指標,包括基尼不純度和相關矩陣。
  • 靈活的剖析:支援結構化、非結構化和基於圖的數據剖析。
  • 可擴展的工作流:允許使用新數據批次更新現有剖析檔,或使用加法運算子合併多個剖析檔。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案