Rizzo-AI-Academy/rizzo-pii

Local-first privacy guard: anonymize your documents before sharing with LLMs.

해결하는 문제

클라우드 기반 LLM(예: ChatGPT, Claude, Gemini)에 민감한 개인 정보 및 기밀 데이터를 전송할 때 발생하는 개인정보 위험을 해결합니다. 특히 이탈리아의 법률, 회계, 공증 서비스 분야의 전문가들에게 문서를 업로드하는 것은 GDPR 준수를 위반할 수 있습니다. 이 프로젝트는 실제 식별 가능한 정보를 전송하지 않고도 강력한 최첨단 모델을 활용할 수 있도록 합니다.

작동 방식

사용자의 로컬 CPU에서 완전히 실행되는 역행 가능한 익명화 워크플로우를 구현합니다:

  1. 로컬 탐지: 가벼운 0.3B 파라미터 모델(기반: mmBERT/ModernBERT)이 codice fiscale, partita IVA 등 이탈리아 법적 식별자 포함 22개 유형의 PII를 식별합니다.
  2. 가명화: 실제 데이터는 안정적이고 유형 인식 가능한 자리 표시자(예: [FULLNAME_1])로 대체됩니다. 매핑 사전은 사용자의 디스크에 로컬로 저장됩니다.
  3. 클라우드 처리: 익명화된 텍스트만 최첨단 LLM에 전송됩니다.
  4. 로컬 복원: LLM이 응답한 후, 도구는 로컬 사전을 사용해 자리 표시자를 원래 실제 값으로 다시 교체합니다.

정확도를 높이기 위해 신경망 모델은 결정론적 정규표현식과 체크섬 네트워크(예: 카드용 Luhn, IBAN용 mod-97)와 결합되어 유효한 체크섬이 발견되면 모델의 판단을 우선시합니다.

대상 사용자

GDPR에 따라 제약을 받는 법무 사무소, 회계사, 공증인, 의료 제공자 등. 계약 요약이나 법적 문서 작성에 LLM을 사용하면서도 민감한 데이터를 자신의 장치에 보관하고 싶은 사용자에게 적합합니다.

주요 특징

  • 이탈리아 법적 특화: 일반 모델이 놓치기 쉬운 이탈리아 고유 식별자(CF, PIVA, 지적 데이터)를 정확히 탐지.
  • 저사양 하드웨어 요구: 표준 노트북 CPU에서 작동 가능. 메모리 사용량 약 0.5 GB ~ 1.2 GB.
  • 역행 가능한 워크플로우: 파괴적인 마스킹과 달리, 최종 출력을 로컬에서 원래 형태로 복원 가능.
  • 프라이버시 디자인: API 키나 텔레메트리 없이 완전히 오프라인으로 작동하여 익명화 단계에서 데이터가 장치 외부로 유출되지 않음.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트