data-privacy-stack/presidio-research

This package features data-science related tasks for developing new recognizers for Presidio. It is used for the evaluation of the entire system, as well as for evaluating specific PII recognizers or PII detection models.

解決的問題

提供一個標準化的框架,用於開發、測試和評估個人識別資訊(PII)檢測模型。它特別幫助開發者從簡單測試進階至精確率與召回率的嚴謹評估,同時透過提供生成合成 PII 資料集的工具,解決高品質訓練資料缺乏的問題。

如何運作

此專案實作了三階段的流程:

  1. 資料生成:使用句子模板(例如:"My name is {{name}}")與虛假 PII 值來建立合成資料集。隨後可對此資料進行分詞,並以 IO、BIO 或 BILUO 等格式建立標籤。
  2. 資料表示:使用標準化的 InputSample 物件,確保資料能輕鬆轉換為不同格式,包括 CoNLL、spaCy v3 與 JSON。
  3. 評估:提供工具來衡量 Presidio Analyzer 或自訂 PII 識別器的效能,支援詳細的錯誤分析,並可在不同模型間進行實體對應。

適用對象

  • 建構或優化 PII 檢測模型與命名實體辨識(NER)系統的開發者。
  • 需要產生合成 PII 資料以擴大訓練資料集中實體值覆蓋範圍的資料科學家。
  • 希望評估其特定設定準確性的 Presidio 框架使用者。

主要特色

  • 合成資料產生器:根據模板產生虛假 PII 句子,避免在訓練中使用真實敏感資料。
  • 多格式支援:可無縫在 JSON、CoNLL 與 spaCy 格式之間轉換資料集。
  • 洩漏防護:提供工具將資料集拆分為訓練/測試/驗證集,同時確保相同模板不會出現在多個折疊中。
  • 全面評估:支援系統整體與個別識別器效能的精確率、召回率與 F 分數分析。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案