BlueFalconHD/apple_generative_model_safety_decrypted

Decrypted Generative Model safety files for Apple Intelligence containing filters

何を解決するか

このプロジェクトは、Apple Intelligenceの生成モデルが使用する安全フィルターやガードレールを復号・分析するための方法と、その結果得られるデータを提供します。研究者は、Appleが異なる地域やロケールで有害なコンテンツをフィルタリングするための正確なフレーズ、正規表現、ルールを確認できます。

動作方法

このプロジェクトは、macOS上の GenerativeExperiencesSafetyInferenceProvider プロセスから暗号化キーを抽出するために、PythonスクリプトとLLDB(Xcodeデバッガー)を組み合わせて使用します。キーを取得した後、暗号化された安全オーバーライドファイルをシステムライブラリから処理する復号スクリプトが実行されます。最後に、メタデータ結合スクリプトにより、これらのフィルターをグローバル、地域別、ロケール別に重複除去・整理し、レビューしやすいJSONファイルに変換します。

対象ユーザー

セキュリティ研究者、AIセーフティアナリスト、Appleのオンデバイス生成AIに実装されたガードレールやコンテンツフィルタリングメカニズムを理解したい興味を持つユーザー。

主な特徴

  • キー抽出: LLDBを介してプログラム的に暗号化キーを取得するスクリプトを含む。
  • 復号ツールキット: システムの安全オーバーライドを読み取り可能なJSON形式に復号するスクリプトを提供。
  • フィルター分析: 復号されたデータを統合メタデータファイルに整理し、グローバルと地域別フィルターを区別可能にする。
  • 詳細なガードレール: rejectremovereplaceルールの具体的な内容を明らかにし、ユーザー入力およびモデル出力の両方に対して正規表現ベースのフィルタリングを含む。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト