ttttccxxui/DataInfra-RedactionEverything

DataInfra Series. Redact EVERYTHING with local llms and vlms.

解决的问题

RedactionEverything 是一个本地优先的文档匿名化工作台,旨在无需将数据发送到远程API的情况下,从非结构化文件(PDF、Word文档、图像和纯文本)中移除敏感信息。它解决了处理混乱的现实世界业务文档(特别是中英文双语文件)的挑战,这些文件不仅包含文本,还包含印章、签名和人脸等视觉元素。

工作原理

该系统采用双路径处理管道:

  1. 文本 + OCR 路径:使用 PP-StructureV3 进行版面分析和OCR,将图像和扫描PDF转换为文本块。然后使用语义NER模型(HaS Text)根据可配置的模式识别敏感实体。还包含一个“红墨水抑制”步骤,用于恢复被红色公司印章遮盖的文本。
  2. 视觉特征路径:使用 LocateAnything-3B 模型对人脸、指纹、身份证、银行卡等视觉特征进行定位。本地 OpenCV 检测器补充检测红色装订线和边缘印章。

两个路径的结果合并并去重后,允许用户在本地审查、修正并导出匿名化文档。

适用人群

适用于处理敏感业务、法律、金融或医疗文档的用户,他们需要严格的隐私边界(本地/内网部署),并且需要从复杂文档布局中同时删除文本和视觉标识符。

主要亮点

  • 本地优先隐私:所有推理和文件处理均在本地GPU工作站或内网中完成。
  • 视觉定位:使用单一定位模型检测签名、印章和人脸等非文本敏感元素。
  • 行业专用预设:包含法律、金融和医疗领域的预配置模式。
  • 全面的文件支持:支持 TXT、DOCX、扫描PDF及多种图像格式。
  • 人机协作:提供完整的工件,用于在最终导出前审查和修正识别结果。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目