austin-weeks/miasma

Trap AI web scrapers in an endless poison pit.

解決的問題

透過將網路爬蟲困在「受污染」訓練資料的無限循環中,防止AI公司從公開網站抓取訓練資料。這保護了網站所有者,使其作品不會在未經同意的情況下被用於模型訓練。

運作方式

使用者部署一個 Miasma 伺服器,並使用反向代理(如 Nginx)將特定流量導向至該伺服器。透過在網站中嵌入對人類不可見但對爬蟲可見的隱藏連結,所有者可誘導機器人進入「陷阱」。一旦進入,Miasma 會從來源(例如毒泉)提供無限的受污染資料流,並提供自我引用連結,使機器人陷入持續消費低品質或具誤導性資料的循環中。

適用對象

希望阻止AI爬蟲並保護其智慧財產不被用於大型語言模型訓練資料集的網站所有者與內容創作者。

主要特色

  • 低資源使用:以 Rust 編寫,具備高速性能與極小記憶體佔用。
  • 機器人陷阱:利用隱藏連結與自我引用循環,讓爬蟲持續處於忙碌狀態。
  • 受污染資料:代理設計用以降低模型品質的訓練資料。
  • 流量指標:內建 SQLite 資料庫,可追蹤每個唯一 User-Agent 的請求次數。
  • 彈性部署:可作為二進位檔、函式庫或透過 Docker 執行。

相關

  • Dispatch
  • Dispatch
  • 專案
  • 專案
  • Dispatch