ttttccxxui/DataInfra-RedactionEverything
DataInfra Series. Redact EVERYTHING with local llms and vlms.
해결하는 문제
RedactionEverything은 데이터를 원격 API에 전송하지 않고 비구조화 파일(PDF, Word 문서, 이미지, 일반 텍스트)에서 민감 정보를 제거하기 위한 로컬 우선 문서 익명화 워크벤치입니다. 특히 중국어-영어 이중 언어 문서를 포함한 실제 비즈니스 문서와 같이 텍스트 외에도 도장, 서명, 얼굴과 같은 시각적 요소를 포함한 복잡한 문서의 익명화 문제를 해결합니다.
작동 방식
이 시스템은 이중 경로 처리 파이프라인을 사용합니다.
- 텍스트 + OCR 경로: PP-StructureV3를 사용하여 레이아웃 분석과 OCR를 수행하여 이미지 및 스캔된 PDF를 텍스트 블록으로 변환합니다. 이후 설정 가능한 스키마를 기반으로 민감한 엔티티를 식별하는 의미적 NER 모델(HaS Text)을 사용합니다. 또한 빨간 회사 도장 아래에 숨겨진 텍스트를 복구하기 위한 '빨간 잉크 억제' 단계도 포함되어 있습니다.
- 시각적 특징 경로: LocateAnything-3B 모델을 사용하여 얼굴, 지문, 신분증, 은행 카드와 같은 시각적 특징을 위치 기반으로 탐지합니다. 로컬 OpenCV 검출기로 빨간 바인딩 및 가장자리 도장을 보완적으로 탐지합니다.
두 경로의 결과를 병합하고 중복 제거한 후, 사용자가 로컬에서 검토, 수정, 내보내기할 수 있도록 합니다.
대상 사용자
민감한 비즈니스, 법무, 금융, 의료 문서를 다루는 사용자에게 적합합니다. 엄격한 프라이버시 경계(로컬/인트라넷 배포)를 요구하며, 복잡한 문서 레이아웃에서 텍스트 및 시각적 식별자를 모두 제거해야 하는 경우에 최적입니다.
주요 특징
- 로컬 우선 프라이버시: 모든 추론 및 파일 처리는 로컬 GPU 워크스테이션 또는 인트라넷에서 수행됩니다.
- 시각적 위치 기반 탐지: 하나의 위치 기반 모델로 서명, 도장, 얼굴과 같은 비텍스트 민감 요소를 탐지합니다.
- 업계별 사전 설정: 법무, 금융, 의료 분야에 맞춘 사전 구성된 스키마를 포함합니다.
- 포괄적인 파일 지원: TXT, DOCX, 스캔된 PDF, 다양한 이미지 형식을 지원합니다.
- 사람이 개입하는 프로세스: 최종 내보내기 전에 인식 결과를 검토하고 수정할 수 있는 완전한 워크벤치를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트