data-privacy-stack/presidio
An open-source framework for detecting, redacting, masking, and anonymizing sensitive data (PII) across text, images, and structured data. Supports NLP, pattern matching, and customizable pipelines.
해결하는 문제
Presidio는 텍스트 및 이미지에서 개인 식별 정보(PII)를 식별하고 익명화함으로써 조직이 민감한 데이터를 관리하고 통제할 수 있는 방법을 제공합니다. 비식별화 기술을 민주화하고 프로세스를 더욱 투명하게 만들어 프라이버시 보호를 돕습니다.
작동 방식
Presidio는 플러그인 방식의 맞춤형 아키텍처를 사용하여 민감한 데이터를 탐지하고 편집합니다. 개체명 인식(NER), 정규 표현식, 규칙 기반 로직 및 체크섬을 포함한 여러 식별 메커니즘을 사용합니다. 또한 외부 PII 탐지 모델에 연결할 수도 있습니다. 이미지의 경우 표준 이미지 유형 및 DICOM 의료 이미지 내의 PII 텍스트를 편집하기 위한 전용 모듈이 포함되어 있습니다.
대상 사용자
Python, PySpark, Docker 및 Kubernetes를 포함한 여러 플랫폼에서 PII 비식별화 흐름을 자동화하거나 반자동화해야 하는 조직을 위해 설계되었습니다.
주요 특징
- 멀티모달 지원: 비정형 텍스트와 이미지(의료용 DICOM 이미지 포함) 모두에서 PII를 처리합니다.
- 유연한 탐지: NER, regex 및 규칙을 사용하여 사전 정의된 인식기와 사용자 정의 인식기를 결합합니다.
- 확장성: 외부 PII 탐지 모델 연결을 지원하며 특정 비즈니스 요구 사항에 맞춰 고도로 맞춤화할 수 있습니다.
- 배포 유연성: pip, Docker 또는 Kubernetes를 통해 배포할 수 있습니다.
관련
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch
- Dispatch