BlueFalconHD/apple_generative_model_safety_decrypted
Decrypted Generative Model safety files for Apple Intelligence containing filters
解决的问题
该项目提供了一种方法及生成的数据,用于解密和分析 Apple Intelligence 生成模型所使用的安全过滤器。它使研究人员能够查看 Apple 在不同地区和语言环境中用于过滤有害内容或执行安全标准的精确短语、正则表达式和规则。
工作原理
该项目结合使用 Python 脚本和 LLDB(Xcode 调试器),从 macOS 上的 GenerativeExperiencesSafetyInferenceProvider 进程中提取加密密钥。获得密钥后,解密脚本会处理位于系统库中的加密安全覆盖文件。最后,元数据合并脚本对这些过滤规则进行去重并组织成全局、区域和语言环境特定的 JSON 文件,便于审查。
适用人群
安全研究人员、AI 安全分析师以及希望了解 Apple 设备端生成式 AI 实施的防护机制和内容过滤机制的用户。
主要亮点
- 密钥提取:包含一个脚本,可通过 LLDB 程序化获取加密密钥。
- 解密工具:提供脚本,将系统安全覆盖文件解密为可读的 JSON 格式。
- 过滤器分析:将解密后的数据整合为元数据文件,区分全局与区域特定的过滤规则。
- 详细防护机制:揭示具体的
reject、remove和replace规则,包括对用户输入和模型输出均适用的正则表达式过滤。
相关
- 项目
- 项目
- 项目
- 项目
- 项目