Hugging Face 使用 Presidio 进行 PII 检测实验
Hugging Face 正在尝试将 Microsoft Presidio(一个开源的 PII 检测工具)集成到 Dataset Hub,以提供有关托管数据集中个人身份信息(PII)存在情况的自动报告。此举旨在提高透明度,并帮助机器学习从业者避免在未记录的敏感数据上训练模型。
ML 数据集中 PII 的普遍性和类型
未记录的私人信息是机器学习数据集中反复出现的问题。Hugging Face 确定了 PII 常见的两类主要数据集:
- Annotated PII Datasets: 这些数据集专门用于训练 PII 检测和掩码模型,这些模型对于诸如在线内容审核和创建匿名数据库等任务至关重要。
- Pre-training Datasets: 这些通常是来源于网络爬取的巨大 TB 级数据集。尽管有过滤措施,但数据量巨大往往会让少量敏感信息绕过检测模型。
PII 的隐私和性能风险
训练数据中存在 PII 会带来伦理和技术两方面的风险。隐私问题至关重要,因为 PII 可用于推断个人的敏感信息。从技术角度看,PII 可能会降低模型性能或引入偏见;例如,模型可能学会将特定 PII 与某些结果关联起来,或在推理过程中无意中从其训练集生成 PII。
在 Dataset Hub 上实施 Presidio 报告
为了降低这些风险,Hugging Face 正在测试一个利用 Presidio 的功能,Presidio 是一种结合机器学习模型和检测模式来识别 PII 的工具。
对从业者和数据集所有者的实用价值
Presidio 报告提供数据集中 PII 存在情况的估计,从而实现两种主要用例:
- For ML Practitioners: 用户可以根据是否需要使用工具如 Presidio 进行进一步过滤,做出是否将数据集用于训练的明智决策。
- For Dataset Owners: 创建者可以在正式向公众发布数据集之前,使用这些报告来验证其 PII 过滤流程的有效性。
示例检测
在使用 C4 预训练数据集的测试案例中,Presidio 报告能够检测到少量的电子邮件和其他敏感 PII,表明该工具能够在大规模数据中标记风险。
合规和伦理框架
此举是更广泛承诺的一部分,旨在提高透明度并推进伦理 AI 开发。Hugging Face 承认 CNIL(法国国家信息与自由委员会)在 GDPR 合规方面的指导,以及在 AI 背景下处理个人数据问题的指引。