austin-weeks/miasma
Trap AI web scrapers in an endless poison pit.
해결하는 문제
공개 웹사이트의 콘텐츠를 AI 기업이 훈련 데이터로 스크래핑하는 것을 방지합니다. 웹 크롤러를 '오염된' 훈련 데이터의 무한 루프에 가두어, 사이트 소유자가 동의 없이 자신의 작업이 모델 훈련에 사용되는 것을 막습니다.
작동 방식
사용자는 Miasma 서버를 배포하고, Nginx와 같은 리버스 프록시를 사용해 특정 트래픽을 서버로 라우팅합니다. 웹사이트에 인간에게는 보이지 않지만 스크래퍼에게는 보이는 숨겨진 링크를 삽입함으로써 봇을 유인합니다. 봇이 안으로 들어오면, Miasma는 '포이즌 포던'과 같은 소스에서 무한한 오염된 데이터를 제공하고, 자기 참조 링크를 통해 봇이 저품질 또는 오해를 유도하는 데이터를 반복적으로 소비하는 루프에 갇히게 합니다.
대상 사용자
AI 스크래퍼를 억제하고, 자신의 지적 재산이 LLM 훈련 데이터에 사용되는 것을 방지하고자 하는 웹사이트 소유자 및 콘텐츠 창작자.
주요 특징
- 저자원 사용: 고속과 최소 메모리 사용을 위한 Rust로 구현.
- 봇 트랩: 숨겨진 링크와 자기 참조 루프를 사용해 스크래퍼를 차단.
- 오염된 데이터: 모델 품질을 저하시키도록 설계된 훈련 데이터를 프록시.
- 트래픽 메트릭스: 고유한 User-Agent별 요청 수를 기록하는 내장 SQLite 데이터베이스.
- 유연한 배포: 바이너리, 라이브러리, Docker로 모두 실행 가능.
관련
- Dispatch
- Dispatch
- 프로젝트
- 프로젝트
- Dispatch