data-privacy-stack/presidio-research

This package features data-science related tasks for developing new recognizers for Presidio. It is used for the evaluation of the entire system, as well as for evaluating specific PII recognizers or PII detection models.

解决的问题

提供一个标准化的框架,用于开发、测试和评估个人身份信息(PII)检测模型。它特别帮助开发者从简单的测试转向对精确率和召回率的严格评估,同时通过提供生成合成 PII 数据集的工具,解决了高质量训练数据缺乏的问题。

工作原理

该项目实现了三部分的流水线:

  1. 数据生成:使用句子模板(例如:"My name is {{name}}")和虚假 PII 值来创建合成数据集。然后可以对这些数据进行分词,并以 IO、BIO 或 BILUO 等格式创建标签。
  2. 数据表示:使用标准化的 InputSample 对象,确保数据可以轻松转换为不同格式,包括 CoNLL、spaCy v3 和 JSON。
  3. 评估:提供工具来衡量 Presidio Analyzer 或自定义 PII 识别器的性能,支持详细的错误分析,并可在不同模型之间映射实体。

适用人群

  • 构建或优化 PII 检测模型和命名实体识别(NER)系统的开发者。
  • 需要生成合成 PII 数据以扩大训练集中实体值覆盖范围的数据科学家。
  • 希望评估其特定配置准确性的 Presidio 框架用户。

主要亮点

  • 合成数据生成器:基于模板生成虚假 PII 句子,避免在训练中使用真实敏感数据。
  • 多格式支持:可无缝在 JSON、CoNLL 和 spaCy 格式之间转换数据集。
  • 泄漏防护:提供工具将数据集拆分为训练/测试/验证集,同时确保同一模板不会出现在多个折叠中。
  • 全面评估:支持对系统整体和单个识别器性能的精确率、召回率和 F 分数分析。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目