austin-weeks/miasma

Trap AI web scrapers in an endless poison pit.

解决的问题

通过将网络爬虫困在‘污染’训练数据的无限循环中,防止AI公司从公开网站抓取训练数据。这保护了网站所有者,使其工作不会在未经同意的情况下被用于模型训练。

工作原理

用户部署一个 Miasma 服务器,并使用反向代理(如 Nginx)将特定流量路由到该服务器。通过在网站中嵌入对人类不可见但对爬虫可见的隐藏链接,所有者可以诱骗机器人进入“陷阱”。一旦进入,Miasma 会从一个来源(例如毒泉)向机器人提供无限的污染数据流,并提供自我引用的链接,使机器人陷入持续消费低质量或误导性数据的循环中。

适用人群

希望阻止AI爬虫并保护其知识产权不被用于大语言模型训练集的网站所有者和内容创作者。

主要亮点

  • 低资源使用:使用 Rust 编写,具备高速性能和极小的内存占用。
  • 机器人陷阱:利用隐藏链接和自我引用循环,使爬虫持续处于忙碌状态。
  • 污染数据:代理设计用于降低模型质量的训练数据。
  • 流量指标:内置 SQLite 数据库,可追踪每个唯一 User-Agent 的请求次数。
  • 灵活部署:可作为二进制文件、库或通过 Docker 运行。

相关

  • Dispatch
  • Dispatch
  • 项目
  • 项目
  • Dispatch