ttttccxxui/DataInfra-RedactionEverything
DataInfra Series. Redact EVERYTHING with local llms and vlms.
解决的问题
RedactionEverything 是一个本地优先的文档匿名化工作台,旨在无需将数据发送到远程API的情况下,从非结构化文件(PDF、Word文档、图像和纯文本)中移除敏感信息。它解决了处理混乱的现实世界业务文档(特别是中英文双语文件)的挑战,这些文件不仅包含文本,还包含印章、签名和人脸等视觉元素。
工作原理
该系统采用双路径处理管道:
- 文本 + OCR 路径:使用 PP-StructureV3 进行版面分析和OCR,将图像和扫描PDF转换为文本块。然后使用语义NER模型(HaS Text)根据可配置的模式识别敏感实体。还包含一个“红墨水抑制”步骤,用于恢复被红色公司印章遮盖的文本。
- 视觉特征路径:使用 LocateAnything-3B 模型对人脸、指纹、身份证、银行卡等视觉特征进行定位。本地 OpenCV 检测器补充检测红色装订线和边缘印章。
两个路径的结果合并并去重后,允许用户在本地审查、修正并导出匿名化文档。
适用人群
适用于处理敏感业务、法律、金融或医疗文档的用户,他们需要严格的隐私边界(本地/内网部署),并且需要从复杂文档布局中同时删除文本和视觉标识符。
主要亮点
- 本地优先隐私:所有推理和文件处理均在本地GPU工作站或内网中完成。
- 视觉定位:使用单一定位模型检测签名、印章和人脸等非文本敏感元素。
- 行业专用预设:包含法律、金融和医疗领域的预配置模式。
- 全面的文件支持:支持 TXT、DOCX、扫描PDF及多种图像格式。
- 人机协作:提供完整的工件,用于在最终导出前审查和修正识别结果。
相关
- 项目
- 项目
- 项目
- 项目
- 项目