data-privacy-stack/presidio

An open-source framework for detecting, redacting, masking, and anonymizing sensitive data (PII) across text, images, and structured data. Supports NLP, pattern matching, and customizable pipelines.

解決する課題

Presidioは、テキストや画像内の個人識別情報(PII)を特定して匿名化することにより、組織が機密データを管理・統制する方法を提供します。匿名化技術を民主化し、プロセスをより透明にすることで、プライバシーの保護を支援します。

仕組み

Presidioは、プラグイン式でカスタマイズ可能なアーキテクチャを使用して、機密データを検出および編集します。識別には、名前付きエンティティ認識(NER)、正規表現、ルールベースのロジック、チェックサムなどの複数のメカニズムを採用しています。また、外部のPII検出モデルに接続することも可能です。画像については、標準的な画像形式およびDICOM医療画像内のPIIテキストを編集するための専用モジュールが含まれています。

対象となるユーザー

Python、PySpark、Docker、Kubernetesを含む複数のプラットフォームにわたって、PIIの匿名化フローを自動化または半自動化する必要がある組織向けに設計されています。

ハイライト

  • マルチモーダル対応: 非構造化テキストと画像(医療用DICOM画像を含む)の両方のPIIを処理します。
  • 柔軟な検出: NER、正規表現、ルールを使用して、定義済みの認識器とカスタム認識器を組み合わせます。
  • 拡張性: 外部のPII検出モデルへの接続をサポートしており、特定のビジネスニーズに合わせて高度にカスタマイズ可能です。
  • デプロイの柔軟性: pip、Docker、またはKubernetesを介してデプロイできます。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • Dispatch
  • Dispatch