BlueFalconHD/apple_generative_model_safety_decrypted

Decrypted Generative Model safety files for Apple Intelligence containing filters

解決的問題

本專案提供一種方法與產生的資料,用於解密與分析 Apple Intelligence 生成模型所使用的安全過濾機制。讓研究人員能夠看見 Apple 在不同地區與語言環境中,用於過濾有害內容或執行安全標準的精確詞句、正規表示式與規則。

運作方式

本專案結合使用 Python 腳本與 LLDB(Xcode 調試器),從 macOS 上的 GenerativeExperiencesSafetyInferenceProvider 進程中提取加密金鑰。取得金鑰後,解密腳本會處理系統程式庫中加密的安全覆寫檔案。最後,元資料合併腳本會對這些過濾規則進行去重並整理成全球、區域與語言環境特定的 JSON 檔案,以利檢閱。

適用對象

安全研究人員、AI 安全分析師,以及想了解 Apple 電腦端生成式 AI 所實施的防護機制與內容過濾機制的使用者。

主要亮點

  • 金鑰提取:包含一個腳本,可透過 LLDB 程式化取得加密金鑰。
  • 解密工具:提供腳本,將系統安全覆寫檔案解密為可讀的 JSON 格式。
  • 過濾器分析:將解密後的資料整合成合併的元資料檔案,以區分全球與區域特定的過濾規則。
  • 詳細防護機制:揭露具體的 rejectremovereplace 規則,包含針對使用者輸入與模型輸出的正規表示式過濾。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案