data-privacy-stack/presidio-research

This package features data-science related tasks for developing new recognizers for Presidio. It is used for the evaluation of the entire system, as well as for evaluating specific PII recognizers or PII detection models.

해결하는 문제

개인식별정보(PII) 검출 모델의 개발, 테스트, 평가를 위한 표준화된 프레임워크를 제공합니다. 단순한 테스트를 넘어서 정밀도와 재현율을 철저히 평가할 수 있도록 도와주며, 고품질 학습 데이터 부족 문제를 해결하기 위해 합성 PII 데이터셋을 생성하는 도구를 제공합니다.

작동 방식

이 프로젝트는 3단계 파이프라인을 구현합니다:

  1. 데이터 생성: 문장 템플릿(예: "My name is {{name}}")과 가짜 PII 값을 사용하여 합성 데이터셋을 생성합니다. 이후 이 데이터를 토큰화하고 IO, BIO, BILUO와 같은 형식으로 태그를 지정할 수 있습니다.
  2. 데이터 표현: 표준화된 InputSample 객체를 사용하여 CoNLL, spaCy v3, JSON 등 다양한 형식 간의 데이터 변환을 쉽게 할 수 있습니다.
  3. 평가: Presidio Analyzer 또는 사용자 정의 PII 인식기의 성능을 측정할 수 있는 도구를 제공하여, 세부적인 오류 분석과 다양한 모델 간 엔티티 매핑을 가능하게 합니다.

대상 사용자

  • PII 검출 모델 및 명명된 엔티티 인식(NER) 시스템을 구축하거나 개선하는 개발자.
  • 학습 데이터셋 내 엔티티 값의 커버리지를 높이기 위해 합성 PII 데이터를 생성해야 하는 데이터 과학자.
  • 특정 구성의 정확도를 평가하고자 하는 Presidio 프레임워크 사용자.

주요 기능

  • 합성 데이터 생성기: 실제 민감한 데이터를 사용하지 않고 템플릿 기반으로 가짜 PII 문장을 생성하여 학습에 활용할 수 있습니다.
  • 다양한 형식 지원: JSON, CoNLL, spaCy 형식 간에 원활하게 데이터 변환 가능합니다.
  • 누출 방지: 동일한 템플릿이 여러 폴드에 나타나지 않도록, 데이터셋을 train/test/validation 세트로 분할하는 도구를 제공합니다.
  • 포괄적인 평가: 시스템 전체 및 개별 인식기 성능에 대해 정밀도, 재현율, F-스코어 분석을 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트