ttttccxxui/DataInfra-RedactionEverything

DataInfra Series. Redact EVERYTHING with local llms and vlms.

解決的問題

RedactionEverything 是一個本地優先的文件匿名化工作台,旨在不將資料傳送至遠端API的情況下,從非結構化文件(PDF、Word文件、影像與純文字)中移除敏感資訊。它解決了處理雜亂的現實世界商業文件(特別是中英文雙語文件)的挑戰,這些文件不僅包含文字,還包含圖章、簽名與臉部等視覺元素。

工作原理

該系統採用雙路徑處理流程:

  1. 文字 + OCR 路徑:使用 PP-StructureV3 進行版面分析與OCR,將影像與掃描PDF轉換為文字區塊。接著使用語意NER模型(HaS Text)根據可設定的模式識別敏感實體。同時包含「紅墨水抑制」階段,用以恢復被紅色公司圖章遮蓋的文字。
  2. 視覺特徵路徑:使用 LocateAnything-3B 模型對臉部、指紋、身分證、銀行卡等視覺特徵進行定位。本地 OpenCV 檢測器補充檢測紅色裝訂線與邊緣圖章。

兩路徑的結果合併並去重後,允許使用者在本地審查、修正並匯出匿名化文件。

適用對象

適用於處理敏感商業、法律、金融或醫療文件的使用者,他們需要嚴格的隱私邊界(本地/內網部署),並需從複雜文件版面中同時刪除文字與視覺識別符。

主要亮點

  • 本地優先隱私:所有推論與文件處理均在本地GPU工作站或內網中完成。
  • 視覺定位:使用單一定位模型檢測簽名、圖章與臉部等非文字敏感元素。
  • 產業專用預設:包含法律、金融與醫療領域的預設設定模式。
  • 全面的文件支援:支援 TXT、DOCX、掃描PDF及多種影像格式。
  • 人機協作:提供完整的工件,用於在最終匯出前審查與修正識別結果。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案