data-privacy-stack/presidio
An open-source framework for detecting, redacting, masking, and anonymizing sensitive data (PII) across text, images, and structured data. Supports NLP, pattern matching, and customizable pipelines.
解決的問題
Presidio 為組織提供了一種管理和治理敏感數據的方法,透過識別並匿名化文本和圖像中的個人識別資訊 (PII)。它透過使去識別化技術民主化並使過程更加透明,有助於保護隱私。
工作原理
Presidio 使用可插拔且可自定義的架構來檢測和編輯敏感數據。它採用多種識別機制,包括命名實體識別 (NER)、正規表示式、基於規則的邏輯和校驗和。它還可以連接到外部 PII 檢測模型。對於圖像,它包含一個專門的模組,用於編輯標準圖像類型和 DICOM 醫學圖像中的 PII 文本。
適用對象
專為需要在 Python、PySpark、Docker 和 Kubernetes 等多個平台中實現 PII 去識別化流程自動化或半自動化的組織而設計。
亮點
- 多模態支持:處理非結構化文本和圖像(包括醫學 DICOM 圖像)中的 PII。
- 靈活的檢測:結合使用 NER、regex 和規則的預定義識別器和自定義識別器。
- 可擴展性:支持連接到外部 PII 檢測模型,並可根據特定的業務需求進行高度定制。
- 部署靈活性:可以透過 pip、Docker 或 Kubernetes 進行部署。
相關
- 專案
- Dispatch
- 專案
- Dispatch
- Dispatch