Rizzo-AI-Academy/rizzo-pii

Local-first privacy guard: anonymize your documents before sharing with LLMs.

解決的問題

解決將敏感個人與機密資料傳送至雲端LLM(如ChatGPT、Claude或Gemini)所帶來的隱私風險。對於法律、會計與公證服務專業人員——特別是在義大利——上傳文件通常違反GDPR合規要求。本專案讓使用者能在不傳輸真實可識別資訊的情況下,利用強大的前沿模型。

工作原理

系統實作了一個完全在使用者本地CPU上執行的可逆匿名化工作流程:

  1. 本地檢測:一個輕量級的0.3B參數模型(基於mmBERT/ModernBERT)識別22類PII,包含特定的義大利法律識別碼,如codice fiscalepartita IVA
  2. 偽匿名化:真實資料被替換為穩定、類型感知的佔位符(例如[FULLNAME_1])。映射字典會本地儲存在使用者的磁碟上。
  3. 雲端處理:僅將匿名化後的文字傳送至前沿LLM。
  4. 本地還原:當LLM回應時,工具使用本地字典將佔位符換回原始真實值。

為確保高準確度,神經模型搭配決定性正規表示式與校驗和網路(例如,卡片使用Luhn,IBAN使用mod-97),當偵測到有效校驗和時,會覆蓋模型判斷。

適用對象

受GDPR約束的律師事務所、會計師、公證人,以及需要使用LLM進行合約摘要或起草法律文件,同時將敏感資料保留在自己裝置上的醫療保健提供者。

主要亮點

  • 義大利法律領域專精:專門檢測義大利特有的識別碼(CF、PIVA、地籍資料),這些常被通用模型忽略。
  • 低硬體需求:可在標準筆電CPU上運行,記憶體佔用約0.5 GB至1.2 GB。
  • 可逆工作流程:與破壞性刪除不同,允許最終輸出在本地還原為原始形式。
  • 隱私設計:完全離線運作,無需API金鑰或遙測,確保匿名化階段資料從不離開裝置。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案