austin-weeks/miasma

Trap AI web scrapers in an endless poison pit.

何を解決するか

AI企業が公開されたウェブサイトをスクレイピングして訓練データとして利用することを防ぎます。Webクローラーを「汚染された」訓練データの無限ループに閉じ込めることで、サイト所有者が同意なく自身の作業がモデルの訓練に使われるのを防ぎます。

動作方法

ユーザーはMiasmaサーバーをデプロイし、Nginxなどのリバースプロキシを使って特定のトラフィックをサーバーにルーティングします。サイトに人間には見えないがスクレイパーには見える隠しリンクを埋め込むことで、ボットを「罠」に誘います。中に入ると、Miasmaはポーションフォンテンから無限に汚染されたデータを提供し、自己参照リンクによりボットが低品質または誤ったデータを継続的に消費するループに閉じ込められます。

対象ユーザー

AIスクレイパーを抑止し、自身の知的財産がLLMの訓練データに使われることを防ぎたいウェブサイト所有者やコンテンツクリエイター。

特徴

  • 低リソース使用: 高速かつメモリ使用量が最小限のRustで構築。
  • ボット罠: 隠しリンクと自己参照ループを使ってスクレイパーを占拠。
  • 汚染されたデータ: モデル品質を低下させるように設計された訓練データをプロキシ。
  • トラフィックメトリクス: ユニークなUser-Agentごとのリクエスト数を記録する組み込みSQLiteデータベース。
  • 柔軟なデプロイ: バイナリ、ライブラリ、Dockerのいずれでも実行可能。

関連

  • Dispatch
  • Dispatch
  • プロジェクト
  • プロジェクト
  • Dispatch