Rizzo-AI-Academy/rizzo-pii
Local-first privacy guard: anonymize your documents before sharing with LLMs.
解決的問題
解決將敏感個人與機密資料傳送至雲端LLM(如ChatGPT、Claude或Gemini)所帶來的隱私風險。對於法律、會計與公證服務專業人員——特別是在義大利——上傳文件通常違反GDPR合規要求。本專案讓使用者能在不傳輸真實可識別資訊的情況下,利用強大的前沿模型。
工作原理
系統實作了一個完全在使用者本地CPU上執行的可逆匿名化工作流程:
- 本地檢測:一個輕量級的0.3B參數模型(基於mmBERT/ModernBERT)識別22類PII,包含特定的義大利法律識別碼,如codice fiscale與partita IVA。
- 偽匿名化:真實資料被替換為穩定、類型感知的佔位符(例如
[FULLNAME_1])。映射字典會本地儲存在使用者的磁碟上。
- 雲端處理:僅將匿名化後的文字傳送至前沿LLM。
- 本地還原:當LLM回應時,工具使用本地字典將佔位符換回原始真實值。
為確保高準確度,神經模型搭配決定性正規表示式與校驗和網路(例如,卡片使用Luhn,IBAN使用mod-97),當偵測到有效校驗和時,會覆蓋模型判斷。
適用對象
受GDPR約束的律師事務所、會計師、公證人,以及需要使用LLM進行合約摘要或起草法律文件,同時將敏感資料保留在自己裝置上的醫療保健提供者。
主要亮點
- 義大利法律領域專精:專門檢測義大利特有的識別碼(CF、PIVA、地籍資料),這些常被通用模型忽略。
- 低硬體需求:可在標準筆電CPU上運行,記憶體佔用約0.5 GB至1.2 GB。
- 可逆工作流程:與破壞性刪除不同,允許最終輸出在本地還原為原始形式。
- 隱私設計:完全離線運作,無需API金鑰或遙測,確保匿名化階段資料從不離開裝置。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案
dataiku/kiji-proxyKiji Privacy Proxy is an open‑source local proxy (macOS desktop app or Linux server) that automatically detects and masks 26 types of personally‑identifiable information in requests to AI services (OpenAI, Anthropic, Gemini, etc.) using an ONNX‑optimized DistilBERT model. It replaces sensitive data with realistic dummy values before forwarding the request, then restores the original data in the response. The tool works transparently via HTTP proxy settings (PAC on macOS, env vars on Linux), includes a Chrome extension for web‑based chat, offers a UI for reviewing masked mappings, and is configurable via custom regexes. All PII processing happens locally, keeping data private and helping meet GDPR/CCPA/HIPAA requirements. Installation is via Homebrew cask on macOS or Debian/Ubuntu packages, Docker, or tarballs. The project is Apache‑2.0 licensed and maintained by Dataiku’s 575 Lab, with full documentation, contribution guides, and security contact information.