data-privacy-stack/presidio
An open-source framework for detecting, redacting, masking, and anonymizing sensitive data (PII) across text, images, and structured data. Supports NLP, pattern matching, and customizable pipelines.
解决的问题
Presidio 为组织提供了一种管理和治理敏感数据的方法,通过识别并匿名化文本和图像中的个人身份信息 (PII)。它通过使去标识化技术民主化并使过程更加透明,有助于保护隐私。
工作原理
Presidio 使用可插拔且可定制的架构来检测和编辑敏感数据。它采用多种识别机制,包括命名实体识别 (NER)、正则表达式、基于规则的逻辑和校验和。它还可以连接到外部 PII 检测模型。对于图像,它包含一个专门的模块,用于编辑标准图像类型和 DICOM 医学图像中的 PII 文本。
适用对象
专为需要在 Python、PySpark、Docker 和 Kubernetes 等多个平台中实现 PII 去标识化流程自动化或半自动化化的组织而设计。
亮点
- 多模态支持:处理非结构化文本和图像(包括医学 DICOM 图像)中的 PII。
- 灵活的检测:结合使用 NER、regex 和规则的预定义识别器和自定义识别器。
- 可扩展性:支持连接到外部 PII 检测模型,并可根据特定的业务需求进行高度定制。
- 部署灵活性:可以通过 pip、Docker 或 Kubernetes 进行部署。
相关
- 项目
- Dispatch
- 项目
- Dispatch
- Dispatch