BlueFalconHD/apple_generative_model_safety_decrypted
Decrypted Generative Model safety files for Apple Intelligence containing filters
解決的問題
本專案提供一種方法與產生的資料,用於解密與分析 Apple Intelligence 生成模型所使用的安全過濾機制。讓研究人員能夠看見 Apple 在不同地區與語言環境中,用於過濾有害內容或執行安全標準的精確詞句、正規表示式與規則。
運作方式
本專案結合使用 Python 腳本與 LLDB(Xcode 調試器),從 macOS 上的 GenerativeExperiencesSafetyInferenceProvider 進程中提取加密金鑰。取得金鑰後,解密腳本會處理系統程式庫中加密的安全覆寫檔案。最後,元資料合併腳本會對這些過濾規則進行去重並整理成全球、區域與語言環境特定的 JSON 檔案,以利檢閱。
適用對象
安全研究人員、AI 安全分析師,以及想了解 Apple 電腦端生成式 AI 所實施的防護機制與內容過濾機制的使用者。
主要亮點
- 金鑰提取:包含一個腳本,可透過 LLDB 程式化取得加密金鑰。
- 解密工具:提供腳本,將系統安全覆寫檔案解密為可讀的 JSON 格式。
- 過濾器分析:將解密後的資料整合成合併的元資料檔案,以區分全球與區域特定的過濾規則。
- 詳細防護機制:揭露具體的
reject、remove與replace規則,包含針對使用者輸入與模型輸出的正規表示式過濾。
相關
- 專案
- 專案
- 專案
- 專案
- 專案