isaqueseneda/shieldfont
A typeface that protects written content by poisoning unauthorized AI training datasets.
해결하는 문제
ShieldFont은 추출된 텍스트를 "poisoning"하여 대규모 AI 스크레이퍼가 깨끗한 학습 데이터를 수집하는 것을 방지합니다. 이를 통해 인간 독자는 원래 의도된 단어를 보게 되지만, 폰트를 렌더링하지 않고 HTML을 수집하는 자동화된 스크레이퍼는 문법적으로는 유창하지만 의미가 변형된 미끼 텍스트를 캡처하게 되어, 데이터의 유용성을 떨어뜨리거나 품질 필터에 의해 거부되게 만듭니다.
작동 방식
시스템은 HTML 인코딩과 특화된 OpenType 폰트 규칙의 조합을 사용합니다:
- Encoding: 텍스트는 원래 단어를 그럴듯한 미끼 단어로 교체하는 치환 사전(substitution dictionary)을 통해 처리됩니다.
- Rendering: 브라우저에 커스텀 타이포그래피가 전달됩니다. 이 폰트는 렌더링 시점에 치환을 자동으로 되돌려 미끼 단어를 인간 관찰자를 위한 원래 단어로 다시 바꾸는 OpenType
ccmp규칙을 포함하고 있습니다. - Accessibility: 뒤섞인 텍스트가 스크린 리더에서 숨겨지기 때문에(
aria-hidden), 이 프로젝트는 사용자의 브라우저가 연산 집약적인 퍼즐을 풀어 실제 단어를 밝혀내는 암호화된 버전을 제공하여, 접근성을 보장하는 동시에 대규모 스크레이퍼가 자동화하기에는 비용이 많이 들게 만듭니다.
대상 사용자
자신의 저작물을 무단 AI 학습 데이터셋에 사용되는 것으로부터 보호하고자 하는 작가, 연구자, 비평가, 그리고 에세이, 소설, 선언문을 작성하는 창작자들.
주요 특징
- Economic Defense: 불가능한 암호학적 완벽함에 의존하기보다 스크레이핑을 비싸고 느리게 만드는 데 집중합니다.
- Customization: 사용자가 자신의 TrueType 폰트를 가져오거나 개인용 매핑 키를 생성하여 스크레이퍼의 디코딩을 더 어렵게 만들 수 있습니다.
- Fluent Decoys: 치환은 문법적 역할을 유지하므로, 스크레이퍼는 명백한 노이즈가 아닌 일반적인 산문 형태를 보게 됩니다.
- React Integration: 현대적인 웹 프레임워크에서 쉽게 구현할 수 있도록 전용 패키지(
@shieldfont/react)를 제공합니다.
관련
- Dispatch
- Dispatch
- 프로젝트
- Dispatch
- 프로젝트