capitalone/DataProfiler
What's in your data? Extract schema, statistics and entities from datasets
解决的问题
DataProfiler 简化了分析、监控和检测数据集内敏感信息的过程。它将识别数据架构、计算统计数据以及识别各种文件格式中的个人身份信息 (PII) 或非公开信息 (NPI) 等繁琐任务自动化。
工作原理
该库使用 Data 类自动检测并将文件(如 CSV、Parquet、JSON 和 Avro)加载到 Pandas DataFrame 中。然后,Profiler 分析这些数据以生成配置文件——一个包含全局统计数据(例如行数、空值率)和列级统计数据(例如平均值、方差、唯一计数)的字典。对于敏感数据检测,它采用预训练的深度学习模型来标记电子邮件地址、信用卡号和 SSN 等实体。用户还可以通过新实体或自定义识别流水线来扩展模型。
适用对象
专为需要快速审计数据集质量或合规性的数据科学家、数据工程师和安全分析师设计,特别是那些出于隐私原因需要识别敏感数据的用户。
亮点
- 自动化敏感数据检测:使用预训练的深度学习模型来识别 PII/NPI 实体。
- 广泛的格式支持:兼容 CSV、TSV、JSON、Avro、Parquet、文本文件和 URL。
- 全面的统计数据:提供详细的全局和列级指标,包括基尼不纯度和相关矩阵。
- 灵活的剖析:支持结构化、非结构化和基于图的数据剖析。
- 可扩展的工作流:允许使用新数据批次更新现有配置文件,或使用加法运算符合并多个配置文件。
相关
- 项目
- Dispatch
- 项目
- 项目
- 项目