isaqueseneda/shieldfont

A typeface that protects written content by poisoning unauthorized AI training datasets.

何を解決するか

ShieldFontは、テキストを「汚染」することで、大量のAIスパム収集ツールがクリーンな学習データを収集することを防ぎます。人間の読者は元の意図された単語をそのまま見ることができますが、レンダリングせずにHTMLを収集する自動化スパム収集ツールは、文法的に自然ではあるが意味がずれた偽のテキストを取得します。これにより、データの有用性が低下したり、品質フィルタで拒否されたりします。

仕組み

このシステムは、HTMLエンコーディングと特別なOpenTypeフォントルールの組み合わせを使用しています:

  1. エンコーディング:テキストは、元の単語を妥当な偽物に置き換える置換辞書を経由して処理されます。
  2. レンダリング:カスタムフォントがブラウザに配信されます。このフォントにはOpenType ccmpルールが含まれており、レンダリング時に自動的に置換を元に戻し、人間の読者には元の単語が表示されます。
  3. アクセシビリティ:スクランブルされたテキストはスクリーンリーダーから非表示(aria-hidden)にされているため、プロジェクトはユーザーのブラウザが計算量の多いパズルを解くことで、実際の単語の暗号化されたバージョンを復元できるようにしています。これによりアクセシビリティを確保しつつ、大量のスパム収集を自動化するにはコストが高くなるように設計されています。

対象ユーザー

AIの不正な学習データセットに使われることを防ぎたい、エッセイ、小説、宣言文などの執筆者、研究者、批評家、クリエイター。

特徴

  • 経済的防御:完全な暗号化の不可能性に頼るのではなく、スパム収集を高コストかつ遅くすることに焦点を当てています。
  • カスタマイズ:独自のTrueTypeフォントを導入したり、スパム収集ツールがデコードしにくくするためのプライベートマッピングキーを生成したりできます。
  • 自然な偽物:置換は文法的役割を維持するため、スパム収集ツールは明らかにノイズの多いテキストではなく、普通の文章を読み取ることになります。
  • React統合:現代のWebフレームワークでの導入を容易にする専用パッケージ(@shieldfont/react)を提供しています。

関連

  • Dispatch
  • Dispatch
  • プロジェクト
  • Dispatch
  • プロジェクト