AI 训练与稀有书籍的破坏性扫描
AI 训练与稀有书籍的破坏性扫描
AI 公司正在以破坏性方式扫描稀有书籍以获取训练数据
报道表明,AI 公司正在批量采购稀有书籍,使用切断书脊的高速机器进行扫描,随后粉碎原始实体副本。据称此过程被用于获取高质量的、2022 年以前的文本——由于其不含 AI 生成内容而被视为高级资源——以训练大型语言模型(LLMs)。
根据 404 Media 的报道和社交媒体讨论,名为 ISBNdb 的服务促成了这些订单,有时涉及多达一百万本书,同时保持买家匿名。该过程对客户被描述为“数字保存”,尽管该服务据称提供 NDA 以确保书籍的销毁保持低调。
法律依据与“Project Panama”
据报道,联邦法官已裁定此行为构成合理使用。提供的法律依据是,通过消除原始实体副本,作品在任意时刻仅存在一个版本(即数字扫描),这据称可以减轻版权侵权主张。
进一步的细节表明,“Project Panama” 存在,这是一项涉及数千万美元的高预算计划,旨在对全球每本书进行破坏性扫描。Anthropic 被特别指出为主要违规方,据称其雇佣了前 Google Books 合作伙伴负责人来领导获取全球图书收藏的工作。
对历史记录和原始资料的风险
批评者认为,纸质书籍的毁坏是对原始资料不可逆转的损失。与可以重新上传的网站抓取或畅销书的再版不同,毁掉最后存世的 18 世纪植物学文本或独特手稿的副本是无法挽回的。
实物文物的损失
实体书籍携带数字扫描所遗漏的数据,包括:
- Marginalia: 边缘手写笔记,提供历史背景。
- Printing and Binding: 书籍的印刷和装订特征,作为其时代的文物。
- Verification: 一旦原始书籍被毁,就没有实体原始资料可用于核对数字副本的准确性。
历史修正主义的潜在风险
人们普遍担忧,毁掉原始资料将允许对历史进行电子篡改。没有实体原始件,数字副本可以被修改以符合特定叙事或政治正确性,而无任何验证手段;一些人将此过程与乔治·奥威尔的《1984》的主题进行比较。
社区观点与反驳
技术和档案社区的讨论表明,对这一实践的看法存在分歧:
反对该实践的论点
- 文化抹杀: 许多人将此视为亚历山大图书馆焚毁的现代版本,形容其为“大遗忘”。
- 伦理问题: 批评者认为,为了训练用于营销邮件的聊天机器人而粉碎书籍,这是对人类遗产损失的不正当权衡。
反驳与细节
- 版权漏洞: 一些人认为这是美国过度限制性版权法的直接结果。他们指出,如果训练 AI 在法律上被允许而无需进行破坏性扫描,公司就不会诉诸这些方法。
- 针对非稀有书籍: 一些怀疑者认为,AI 公司主要针对仍处于版权期但已绝版的书籍,而非真正不可替代的古籍手稿,因为后者批量获取成本过高或过于罕见。
- “模拟漏洞”: 一些观察者指出,对于 AI 公司而言,购买实体书并进行扫描相比向已就影子图书馆数据起诉 AI 公司的出版商支付高额许可费要便宜得多。
"我们粉碎稀有书籍并提供 NDA,以确保无人发现,这是 2026 年一种合法的商业模式。"
与现有档案实践的比较
一些档案专业人士指出,“破坏性扫描”(切断装订)并非新事物,但这里的关键区别在于之后会对页面进行粉碎。传统档案通常会将切断的页面存放在密封的塑料袋中,无限期保存,以便重新扫描或保存;而据称 AI 流程则出于成本效益考虑而销毁这些页面。
摘要: 报道表明,AI 公司正在批量采购并高速扫描后粉碎稀有书籍以创建训练数据,据称此做法被视为在合理使用下合法,以确保仅存在一份副本。 }