AI 训练与书籍的物理毁灭

AI 公司正在购买并销毁实体书以获取训练数据

据报道,AI 公司正通过中间商购买数百万本二手实体书,将其扫描为训练数据,随后销毁这些纸质副本。这种做法的驱动力在于对“未经机器触碰”的高质量训练数据的需求——特别是 2022 年之前出版的内容——以避免当前充斥互联网的 AI 生成内容的噪声。

根据 Anna’s Archive 的一份报告,Anthropic 的 "Project Panama" 是这一趋势的一个主要例子。据称,该项目涉及花费数千万美元购买、扫描并销毁数百万本纸质书籍,以训练 Claude LLM。这一策略的动机有三个方面:

  1. 竞争优势:防止竞争对手扫描并使用相同的物理来源。
  2. 法律缓解:减少与数字版权侵权相关的法律风险。
  3. 成本效率:销毁书籍通常比维护无损扫描存档更便宜。

知识私有化的风险

系统性地扫描并销毁实体书会带来一种风险,即人类知识被永久垄断在私人公司服务器上。虽然 AI 助手可能会变得更加强大,但底层的原始资料可能会从公共领域消失。这创造了一个悖论:那些承诺让知识变得触手可及的公司,同时也在拆解知识的物理载体。

Anna’s Archive 已呼吁发起全球志愿者行动,扫描并上传稀有书籍、期刊、报纸和杂志,以建立一个“数字亚历山大图书馆”,以确保人类文明的记忆保持自由且可获取。 这种紧迫性因以下因素而放大:

  • AI 内容饱和:自 2025 年初以来,AI 生成的内容已占到互联网新出版物的半数以上,使得区分人类创作的作品变得更加困难。
  • 数据垄断:如果 AI 公司是销毁的书籍数字扫描件的唯一持有者,他们就控制了对该信息的访问权。

批判性观点与反论点

Hacker News 上的社区讨论揭示了对这些说法的高度怀疑和细微差别。出现了几个关键的反论点:

版权法的作用

一些人认为,销毁书籍并非 AI 公司出于恶意而做出的选择,而是“卡夫卡式”版权法的要求。在某些法律框架下,将书籍数字化需要销毁原件,以确保许可权是转移而非复制。

规模与稀缺性

许多批评者质疑“稀有”书籍是否真的成为了目标。他们认为,AI 公司购买的是大批量的二手书,而这些书如果不被购买,原本就会在书架上腐烂或被专业书籍经销商销毁。正如一位评论者所指出的:

"Actual professional specialized book dealers pulp books by the millions... model trainers only have use for a single copy of a book. Even if they were literally burning these books to spite you, they'd be destroying an infinitesimal fraction of the books the book trade already destroys."

机构保存

其他人指出,国家图书馆(如美国的 Library of Congress 或英国的 British Library)都有法定保存要求,这意味着几乎每本出版的书籍都会有一份副本已保存在政府资助的档案馆中,因此知识的完全丧失不太可能发生。

"保存"悖论

一些人认为,扫描并针对书籍训练模型本身就是一种形式的保存。如果一本书籍很晦涩且无人问津,将其转化为 LLM 中的权重,可能是其信息触及更广泛受众的唯一途径,即使物理副本被销毁了。

冲突总结

紧张局势的核心在于关于知识应如何存储和访问的基本分歧。一方是推动建立开放、去中心化的影子图书馆以防止企业垄断的呼吁;另一方则是商业书籍市场的现实,以及在数字化过程中激励销毁物理媒介的法律体系。

Sources

相关