AI 訓練與實體書本的物理毀滅

AI 公司正透過購買並毀滅實體書來獲取訓練數據

據報導,AI 公司正透過中間商收購數百萬本二手實體書,將其掃描以獲取訓練數據,隨後毀滅這些實體副本。這種做法是由於需要「未經機器觸碰」的高品質訓練數據——特別是 2022 年以前出版的內容——以避免目前充斥於網路上的 AI 生成內容所產生的雜訊。

根據 Anna’s Archive 的報告,Anthropic 的 "Project Panama" 是這一趨勢的主要案例。據稱,該項目涉及花費數千萬美元購買、掃描並毀滅數百萬本紙本書籍,以訓練 Claude LLM。這種策略的動機有三點:

  1. 競爭優勢:防止競爭對手掃描並使用相同的實體來源。
  2. 法律緩解:減少與數位版權侵權相關的法律風險。
  3. 成本效率:毀滅書籍往往比維護無損掃描存檔更便宜。

知識私有化的風險

系統性地掃描並毀滅實體書會造成一種風險,即人類知識被永久壟斷在私人企業的伺服器上。雖然 AI 助手可能會變得更加強大,但底層的原始資料來源可能會從公共領域消失。這造成了一個悖論:那些承諾讓知識變得觸手可及的公司,同時也在拆解知識的實體載體。

Anna’s Archive 已呼籲全球志願者共同努力,掃描並上傳稀有書籍、期刊、學術論文、報紙和雜誌,以建立一個「數位亞歷山大圖書館」,以確保人類文明的記憶能保持自由且可獲取。 這種緊迫性因以下因素而加劇:

  • AI 內容飽和:自 2025 年初以來,AI 生成的內容已佔新網路出版物的半數以上,使得區分人類創作的作品變得更加困難。
  • 數據壟斷:如果 AI 公司是毀滅書籍的數位掃描檔的唯一持有者,他們就控制了對該資訊的獲取的權限。

批判性觀點與反駁論點

Hacker News 社群的討論揭示了對這些說法的顯著懷疑與細微差別。出現了幾個關鍵的反駁論點:

版權法的作用

有些人認為,毀滅書籍並非 AI 公司出於惡意的選擇,而是「卡夫卡式」版權法的要求。在某些法律框架下,將書籍數位化需要毀滅原件以確保授權是轉讓而非複製。

規模與稀有性

許多批評者質疑「稀有」書籍是否真的成為了目標。他們認為,AI 公司購買的是大量二手書,而這些書原本就在書架上腐爛,或者註定要被專業書商被製成紙漿。

正如一位評論者所說:

"Actual professional specialized book dealers pulp books by the millions... model trainers only have use for a single copy of a book. Even if they were literally burning these books to spite you, they'd be destroying an infinitesimal fraction of the books the book trade already destroys."

機構式保存

其他人指出,國家圖書館(例如美國的 Library of Congress 或英國的 British Library)具有法定保存要求,這意味著幾乎每本出版的書籍都會在政府資助的存檔中保存一份副本,因此知識的完全喪失不太可能發生。

「保存」悖論

有些人認為,對書籍進行掃描並以此訓練模型是一種保存形式。如果一本書很冷門且沒人閱讀,將其轉化為 LLM 中的權重(weights)可能是其資訊能接觸到更廣泛受眾的唯一方式,即使實體副本被毀滅了。

衝突總結

這種緊張關係的核心在於對於知識應如何儲存與獲取的根本分歧。一方是推動開放、去中心化的影子圖書館(shadow libraries)以防止企業壟斷;另一方則是商業圖書市場的現實,以及一個在數位化過程中會鼓勵毀滅實體媒介的法律體系。

Sources

相關