BlueFalconHD/apple_generative_model_safety_decrypted
Decrypted Generative Model safety files for Apple Intelligence containing filters
해결하는 문제
이 프로젝트는 Apple Intelligence의 생성 모델이 사용하는 안전 필터를 복호화하고 분석하는 방법과 그 결과로 얻은 데이터를 제공합니다. 연구자들은 Apple이 다양한 지역 및 로케일에서 유해 콘텐츠를 필터링하거나 안전 기준을 강제하기 위해 사용하는 정확한 문구, 정규 표현식, 규칙을 확인할 수 있습니다.
작동 방식
이 프로젝트는 macOS의 GenerativeExperiencesSafetyInferenceProvider 프로세스에서 암호화 키를 추출하기 위해 Python 스크립트와 LLDB(Xcode 디버거)를 결합하여 사용합니다. 키를 확보한 후, 시스템 라이브러리에 위치한 암호화된 안전 오버라이드 파일을 처리하는 복호화 스크립트가 실행됩니다. 마지막으로 메타데이터 결합 스크립트는 이러한 필터를 중복 제거하고 글로벌, 지역별, 로케일별 JSON 파일로 정리하여 검토를 용이하게 합니다.
대상 사용자
보안 연구자, AI 안전 분석가, 그리고 Apple의 온디바이스 생성형 AI에 구현된 가드레일과 콘텐츠 필터링 메커니즘을 이해하고자 하는 호기심 많은 사용자들.
주요 특징
- 키 추출: LLDB를 통해 프로그래밍 방식으로 암호화 키를 추출하는 스크립트 포함.
- 복호화 도구: 시스템 안전 오버라이드를 읽기 쉬운 JSON 형식으로 복호화하는 스크립트 제공.
- 필터 분석: 복호화된 데이터를 통합 메타데이터 파일로 정리하여 글로벌 및 지역별 필터를 구분 가능하게 함.
- 세부적인 가드레일:
reject,remove,replace규칙의 구체적인 내용을 공개하며, 사용자 입력 및 모델 출력 모두에 대한 정규 표현식 기반 필터링 포함.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트