# OpenAI 隱私過濾器:構建可擴展的 PII 偵測網頁應用
OpenAI 隱私過濾器:構建可擴展的 PII 偵測網頁應用
OpenAI 已發布 Privacy Filter,一個開源的個人可識別資訊(PII)偵測器,旨在識別並標記八個不同類別的敏感文本。該模型之所以重要,是因為它能夠在單次前向傳遞中處理 128k token 的上下文,從而無需進行文本分塊,並確保精確的跨度偏移。
隱私過濾器模型規格
Privacy Filter 是一個具有 1.5B 參數、50M 活躍參數的模型,採用 Apache 2.0 授權發布。該模型在 PII-Masking-300k 基準測試上達到最先進的性能。
技術能力
- 內容視窗: 128,000 個 token。
- PII 類別: 模型可偵測八種類別:
private_person,private_address,private_email,private_phone,private_url,private_date,account_number, 和secret。 - 效率: 模型在單次前向傳遞中進行標註,這能保持長文件中跨度邊界和偏移的完整性。
透過 gradio.Server 的實際實作
Hugging Face 透過使用 gradio.Server 構建了三個可擴展的網頁應用,展示了該模型的實用性。此框架允許開發者將自訂的 HTML/JS 前端與 Gradio 的後端功能結合,例如 ZeroGPU 配置和請求排隊。
1. 文件隱私探索器
此應用程式允許使用者上傳 PDF 或 DOCX 檔案,以就地標記 PII 範圍。
- 技術方法: 整個文件在一次 128k 上下文通過中處理。使用 BIOES 解碼來確保在長而模糊的文本運行期間跨度邊界乾淨。
- 基礎設施:
gr.Server將讀取視圖作為單一 HTML 檔案提供,並透過排隊的@server.api端點公開模型,允許同時上傳的檔案被序列化並透過 ZeroGPU 處理。
2. 圖像匿名化工具
此工具通過在敏感資料上放置黑色條形來從圖像和螢幕截圖(例如 Slack 對話或收據)中刪除 PII。
- 技術方法: 系統使用 Tesseract 進行 OCR 以生成每個詞的邊界框。後端將字符偏移映射到這些框上,並在重建的文字上運行 Privacy Filter。檢測到的跨度隨後被轉換為像素矩形以進行遮蓋。
- 基礎設施: 自訂的
<canvas>前端處理互動元素——例如切換、拖曳或手動繪製遮蓋條——而@server.api端點提供像素座標。
3. SmartRedact 貼紙
這是一個專注於遮蓋的貼上工具,它會生成兩個獨立的 URL:一個公開的遮蓋版本和一個私密的顯示版本。
- 技術方法: 檢測到的 PII 範圍會被
<CATEGORY>佔位符(例如<PRIVATE_EMAIL>)取代。該模型的多語言能力使其能夠在不修改的情況下處理西班牙語、法語、中文和印地語的文本。 - 基礎設施: 由於
gr.Server建構在 FastAPI 上,該應用同時使用@server.api進行模型密集的遮蓋過程,並使用純@server.get路由來提供需要令牌的視圖頁面。
可擴展 AI 應用的架構模式
Privacy Filter 在這些應用中的整合遵循一致的架構劃分,即排隊計算與靜態路由:
| 應用程式 | 排隊計算 (@server.api) |
純 FastAPI 路由 |
|---|---|---|
| 文件隱私探索器 | 文字擷取、PII 偵測與統計 | 提供自訂讀取器 HTML 視圖 |
| 圖像匿名化工具 | OCR、PII 偵測與像素框映射 | 提供 canvas UI 與範例 |
| SmartRedact 貼紙 | PII 偵測與遮蓋 | 公開及需令牌的視圖頁面 |
透過使用 @server.api,開發者可以獲得 Gradio 的佇列以及 ZeroGPU 上的 @spaces.GPU 組合,而純 FastAPI 路由則處理如 HTML 傳輸和字典查詢等輕量任務。