# OpenAI 隐私过滤器:构建可扩展的 PII 检测 Web 应用
OpenAI 隐私过滤器:构建可扩展的 PII 检测 Web 应用
OpenAI 已发布 Privacy Filter,这是一个开源的个人可识别信息(PII)检测器,旨在识别并标记八个不同类别的敏感文本。该模型之所以重要,是因为它能够在一次前向传递中处理 128k token 上下文,从而消除了对文本分块的需求,并确保了精确的跨度偏移。
Privacy Filter 模型规范
Privacy Filter 是一个具有 15亿参数的模型,其中有效参数为 50M,采用 Apache 2.0 许可证发布。它在 PII-Masking-300k 基准测试中达到了最先进的性能。
技术能力
- 上下文窗口: 128,000 个 token。
- PII 类别: 模型可检测八类:
private_person、private_address、private_email、private_phone、private_url、private_date、account_number和secret。 - 效率: 模型在一次前向传递中完成标注,这能够在长文档中保持跨度边界和偏移的完整性。
通过 gradio.Server 的实际实现
Hugging Face 通过使用 gradio.Server 构建了三个可扩展的 Web 应用来展示该模型的实用性。此框架允许开发者将自定义 HTML/JS 前端与 Gradio 的后端功能结合,例如 ZeroGPU 分配和请求排队。
1. 文档隐私探索器
此应用允许用户上传 PDF 或 DOCX 文件,以便就地高亮显示 PII 跨度。
- 技术方法: 整个文档在一次 128k 上下文通道中处理。使用 BIOES 解码来确保在长而模糊的文本运行中跨度边界清晰。
- 基础设施:
gr.Server将读取视图作为单个 HTML 文件提供,并通过排队的@server.api公开模型,使得并发上传可以被序列化并在 ZeroGPU 上处理。
2. 图像匿名化工具
此工具通过在敏感数据上放置黑色条形来从图像和截图(例如 Slack 对话或收据)中删除 PII。
- 技术方法: 系统使用 Tesseract 进行 OCR 以生成每个词的边界框。后端将字符偏移映射到这些框上,并在重构的文本上运行 Privacy Filter。检测到的跨度随后被转换为像素矩形以进行删除。
- 基础设施: 自定义
<canvas>前端处理交互元素——例如切换、拖拽或手动绘制删除条——而@server.api端点提供像素坐标。
3. SmartRedact 粘贴
这是一个专注于删除的粘贴 bin,它生成两个独立的 URL:一个公开的删除版本和一个私有的显示版本。
- 技术方法: 检测到的 PII 跨度将被
<CATEGORY>占位符替换(例如<PRIVATE_EMAIL>)。模型的多语言能力使其能够在不修改的情况下处理西班牙语、法语、中文和印地文本。 - 基础设施: 由于
gr.Server基于 FastAPI 构建,该应用同时使用@server.api处理模型密集的删除过程,并使用普通的@server.get路由提供受令牌保护的查看页面。
可扩展 AI 应用的架构模式
Privacy Filter 在这些应用中的集成遵循一种一致的架构划分:队列计算与静态路由。
| 应用 | 队列计算 (@server.api) |
普通 FastAPI 路由 |
|---|---|---|
| 文档隐私探索器 | 文本提取、PII 检测和统计 | 提供自定义阅读器 HTML 视图 |
| 图像匿名化工具 | OCR、PII 检测和像素框映射 | 提供 canvas UI 和示例 |
| SmartRedact 粘贴 | PII 检测和删除 | 公开和受令牌保护的查看页面 |
通过使用 @server.api,开发者可以访问 Gradio 的队列以及 ZeroGPU 上的 @spaces.GPU 组合,而普通 FastAPI 路由则处理诸如 HTML 交付和字典查找之类的轻量级任务。