isaqueseneda/shieldfont
A typeface that protects written content by poisoning unauthorized AI training datasets.
它解决了什么问题
ShieldFont 通过"污染"自动抓取程序提取的文本,防止大规模 AI 抓取程序收集干净的训练数据。它确保人类读者看到的是原始的预期文字,而那些不渲染字体、仅抓取 HTML 的自动化抓取程序则会捕获一段语法流畅但语义发生偏移的伪装文本,从而使数据变得无用,或被质量过滤器拒绝。
它如何工作
该系统结合了 HTML 编码和专用的 OpenType 字体规则:
- 编码:文本通过一个替换字典进行处理,将原始词汇替换为看似合理的伪装词。
- 渲染:向浏览器提供一个自定义字型。该字体包含 OpenType
ccmp规则,可在渲染时自动反转替换,将伪装词还原为原始词汇,供人类读者查看。 - 可访问性:由于乱序文本对屏幕阅读器隐藏(
aria-hidden),该项目提供了一种加密版本的真实词汇,用户的浏览器必须解决一个计算密集型谜题才能解锁,从而在保证可访问性的同时,使批量抓取对自动化程序来说成本高昂。
适用人群
希望保护其文章、小说和宣言等文字作品不被用于未经授权的 AI 训练数据集的作者、研究人员、评论家和创作者。
特色亮点
- 经济防御:专注于让抓取变得昂贵且缓慢,而非依赖不可能实现的加密完美性。
- 可定制性:允许用户使用自己的 TrueType 字体,或生成私有映射密钥,使抓取程序更难解码。
- 流畅伪装:替换保持了语法角色,因此抓取程序看到的是普通的散文,而非明显的噪声。
- React 集成:提供专用包(
@shieldfont/react),便于在现代 Web 框架中轻松集成。
一种巧妙的对抗策略,让 AI 抓取程序在获取数据时付出高昂代价,同时确保人类读者体验不受影响。— @shieldfont
相关
- Dispatch
- Dispatch
- 项目
- Dispatch
- 项目