AI 訓練與稀有書籍的破壞性掃描

AI 訓練與稀有書籍的破壞性掃描

AI 公司正在破壞性掃描稀有書籍以獲取訓練資料

報告指出,AI 公司正在大量購買稀有書籍,使用高速機器掃描並切除書脊,隨後將原始實體複製粉碎。此過程據稱被用來取得高品質、2022 年以前的文字——這被視為高級資料,因其不含 AI 生成的內容——以訓練大型語言模型(LLMs)。

根據 404 Media 的報告和社交媒體討論,一項名為 ISBNdb 的服務促成這些訂單,有時涉及多達一百萬本書,同時保持買家匿名。該過程對客戶被描述為「數位保存」,儘管該服務據稱提供 NDA 以確保書籍的銷毀保持低調。

法律依據與 "Project Panama"

據報導,聯邦法官裁定此構成合理使用。提供的法律依據是:通過消除原始實體複製,同一時間只存在一份作品的版本(數位掃描),這據稱減輕了著作權侵權的主張。

進一步的細節顯示存在 "Project Panama",一項涉及數千萬美元預算的高預算計畫,旨在對全球每一本書進行破壞性掃描。Anthropic 被特別點名為主要違規者,據稱僱用了前 Google Books 合作夥伴負責人來領導取得全球書籍收藏的工作。

對歷史記錄和主要來源的風險

批評者指出,實體書籍的銷毀是主要來源不可逆轉的損失。與可以重新上傳的網站刮取,或重印暢銷書不同,最後剩餘的 18 世紀植物學文獻或獨手稿的複製被銷毀無法復原。

實體遺物的損失

實體書籍攜帶數位掃描所遺漏的資料,包括:

  • Marginalia: 邊註的手寫筆記,提供歷史背景。
  • 印刷與裝訂: 作為其時代 artefactual 的書籍實體特徵。
  • 驗證: 一旦原始本被銷毀,就沒有實體主要來源可用來對照數位複製的正確性。

歷史修正主義的潛在風險

人們擔心銷毀原始來源將允許電子重寫歷史。沒有實體原本,數位副本可以被修改以適應特定敘事或政治正確性,而無任何驗證手段,這種過程被一些人與喬治·歐威爾的《1984》主題相比較。

社群觀點與反論

技術與檔案社群的討論顯示對此做法的看法存在分歧:

反對此做法的論點

  • 文化抹除: 許多人將此視為亞歷山大圖書館燒毀的現代版本,形容為 "The Great Forgetting"。
  • 倫理關切: 批評者主張,為了訓練用於行銷郵件的聊天機器人而粉碎書籍,對於人類遺產的損失而言是無法正當化的交換。

反論與細節

  • 著作權漏洞: 一些人認為這是過度限制的美國著作權法的直接結果。他們建議,如果訓練 AI 在法律上被允許而無需破壞性掃描,公司將不會訴諸此類方法。
  • 針對非稀有書籍: 一些懷疑者指出,AI 公司主要針對仍在版權保護期內但已絕版的書籍,而非真正無法替換的古手稿,因為後者在大量採購時成本過高或過於罕見。
  • "類比漏洞": 一些觀察者指出,對 AI 公司而言,購買實體書籍並進行掃描,相較於向曾因影子圖書館數據而起訴 AI 公司的出版商支付高昂授權費用,要便宜得多。

"我們粉碎稀有書並提供 NDA,以免有人發現,這是 2026 年的一種合法商業模式。"

與現有檔案實務的比較

一些檔案專業人士指出,「破壞性掃描」(切除裝訂)並非新事物,但此處的關鍵差異在於之後將頁面粉碎。傳統檔案通常會將切開的頁面無限期地存放在密封塑膠袋中,以允許重新掃描或保存,而 AI 流程據稱則出於成本效益考慮將其銷毀。

Sources