capitalone/DataProfiler

What's in your data? Extract schema, statistics and entities from datasets

解决的问题

DataProfiler 简化了分析、监控和检测数据集内敏感信息的过程。它将识别数据架构、计算统计数据以及识别各种文件格式中的个人身份信息 (PII) 或非公开信息 (NPI) 等繁琐任务自动化。

工作原理

该库使用 Data 类自动检测并将文件(如 CSV、Parquet、JSON 和 Avro)加载到 Pandas DataFrame 中。然后,Profiler 分析这些数据以生成配置文件——一个包含全局统计数据(例如行数、空值率)和列级统计数据(例如平均值、方差、唯一计数)的字典。对于敏感数据检测,它采用预训练的深度学习模型来标记电子邮件地址、信用卡号和 SSN 等实体。用户还可以通过新实体或自定义识别流水线来扩展模型。

适用对象

专为需要快速审计数据集质量或合规性的数据科学家、数据工程师和安全分析师设计,特别是那些出于隐私原因需要识别敏感数据的用户。

亮点

  • 自动化敏感数据检测:使用预训练的深度学习模型来识别 PII/NPI 实体。
  • 广泛的格式支持:兼容 CSV、TSV、JSON、Avro、Parquet、文本文件和 URL。
  • 全面的统计数据:提供详细的全局和列级指标,包括基尼不纯度和相关矩阵。
  • 灵活的剖析:支持结构化、非结构化和基于图的数据剖析。
  • 可扩展的工作流:允许使用新数据批次更新现有配置文件,或使用加法运算符合并多个配置文件。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • 项目