# OpenAI 隱私過濾器:構建可擴展的 PII 偵測網頁應用

OpenAI 隱私過濾器:構建可擴展的 PII 偵測網頁應用

OpenAI 已發布 Privacy Filter,一個開源的個人可識別資訊(PII)偵測器,旨在識別並標記八個不同類別的敏感文本。該模型之所以重要,是因為它能夠在單次前向傳遞中處理 128k token 的上下文,從而無需進行文本分塊,並確保精確的跨度偏移。

隱私過濾器模型規格

Privacy Filter 是一個具有 1.5B 參數、50M 活躍參數的模型,採用 Apache 2.0 授權發布。該模型在 PII-Masking-300k 基準測試上達到最先進的性能。

技術能力

  • 內容視窗: 128,000 個 token。
  • PII 類別: 模型可偵測八種類別:private_person, private_address, private_email, private_phone, private_url, private_date, account_number, 和 secret
  • 效率: 模型在單次前向傳遞中進行標註,這能保持長文件中跨度邊界和偏移的完整性。

透過 gradio.Server 的實際實作

Hugging Face 透過使用 gradio.Server 構建了三個可擴展的網頁應用,展示了該模型的實用性。此框架允許開發者將自訂的 HTML/JS 前端與 Gradio 的後端功能結合,例如 ZeroGPU 配置和請求排隊。

1. 文件隱私探索器

此應用程式允許使用者上傳 PDF 或 DOCX 檔案,以就地標記 PII 範圍。

  • 技術方法: 整個文件在一次 128k 上下文通過中處理。使用 BIOES 解碼來確保在長而模糊的文本運行期間跨度邊界乾淨。
  • 基礎設施: gr.Server 將讀取視圖作為單一 HTML 檔案提供,並透過排隊的 @server.api 端點公開模型,允許同時上傳的檔案被序列化並透過 ZeroGPU 處理。

2. 圖像匿名化工具

此工具通過在敏感資料上放置黑色條形來從圖像和螢幕截圖(例如 Slack 對話或收據)中刪除 PII。

  • 技術方法: 系統使用 Tesseract 進行 OCR 以生成每個詞的邊界框。後端將字符偏移映射到這些框上,並在重建的文字上運行 Privacy Filter。檢測到的跨度隨後被轉換為像素矩形以進行遮蓋。
  • 基礎設施: 自訂的 <canvas> 前端處理互動元素——例如切換、拖曳或手動繪製遮蓋條——而 @server.api 端點提供像素座標。

3. SmartRedact 貼紙

這是一個專注於遮蓋的貼上工具,它會生成兩個獨立的 URL:一個公開的遮蓋版本和一個私密的顯示版本。

  • 技術方法: 檢測到的 PII 範圍會被 <CATEGORY> 佔位符(例如 <PRIVATE_EMAIL>)取代。該模型的多語言能力使其能夠在不修改的情況下處理西班牙語、法語、中文和印地語的文本。
  • 基礎設施: 由於 gr.Server 建構在 FastAPI 上,該應用同時使用 @server.api 進行模型密集的遮蓋過程,並使用純 @server.get 路由來提供需要令牌的視圖頁面。

可擴展 AI 應用的架構模式

Privacy Filter 在這些應用中的整合遵循一致的架構劃分,即排隊計算與靜態路由:

應用程式 排隊計算 (@server.api) 純 FastAPI 路由
文件隱私探索器 文字擷取、PII 偵測與統計 提供自訂讀取器 HTML 視圖
圖像匿名化工具 OCR、PII 偵測與像素框映射 提供 canvas UI 與範例
SmartRedact 貼紙 PII 偵測與遮蓋 公開及需令牌的視圖頁面

透過使用 @server.api,開發者可以獲得 Gradio 的佇列以及 ZeroGPU 上的 @spaces.GPU 組合,而純 FastAPI 路由則處理如 HTML 傳輸和字典查詢等輕量任務。

Sources