AI トレーニングと希少書籍の破壊的スキャン
AI トレーニングと希少書籍の破壊的スキャン
AI 企業は希少書籍のトレーニングデータのために破壊的スキャンを行っている
報告によると、AI企業は希少書籍を大量に購入し、高速機械で背表紙を切り離してスキャンし、そして元の物理的コピーをシュレッダーにかける。このプロセスは allegedly 、高品質のpre-2022テキストを取得するために使われているとされている。これはAI生成コンテンツが含まれていないためプレミアムとみなされ、大規模言語モデル(LLM)のトレーニングに使用される。
404 Media の報告とソーシャルメディアの議論によると、ISBNdb と呼ばれるサービスがこれらの注文を仲介し、場合によっては最大100万冊を含むことがあるが、購入者の匿名性を保ちながら。このプロセスはクライアントに対して「デジタル保存」と説明されるが、ただし、このサービスは reportedly 、書籍の破壊が秘密にされるように NDA を提供しているとされる。
法的正当化と「Project Panama"
連邦裁判官は reportedly 、この慣行がフェアユースに該当すると裁定したとされる。提示された法的根拠は、元の物理的コピーを排除することで、その時点で作品のバージョンは1つだけ(デジタルスキャン)存在し、これにより著作権侵害の主張が allegedly 軽減されるというものである。
さらなる詳細から、「Project Panama」と呼ばれる、世界中の書籍の破壊的スキャンを目的とした数千万ドル規模のイニシアティブが存在することが示唆されている。Anthropic は特に主要な違反者として挙げられており、 reportedly 、Google Books パートナーシップの元責任者を雇い、世界中の書籍コレクションの取得をリードしているとされる。
歴史的記録と一次資料へのリスク
批評家は、物理書籍の破壊は一次資料の不可逆的な損失であると主張する。ウェブサイトのスクレイピングは再アップロード可能であり、ベストセラーの再版も可能だが、18世紀の植物学テキストや独自の手稿の最後の残りのコピーの破壊は元に戻すことができない。
物理的アーティファクトの損失
物理書籍は、デジタルスキャンでは省かれるデータを運び、以下を含む:
- 余白書き込み: 余白に書かれた手書きの注釈で、歴史的文脈を提供する。
- 印刷と製本: その時代を表す artefactual な物理的特徴。
- 検証: 元の本が破壊されると、デジタルコピーの正確性を確認するための物理的一次資料がなくなる。
歴史修正主義の可能性
元の出典を破壊することで歴史の電子的書き換えが可能になるという懸念が大きい。物理的オリジナルがない場合、デジタルコピーは検証手段なく特定のナラティブや政治的正しさに合わせて改変される可能性があり、このプロセスは一部の人によって George Orwell の 1984 のテーマと比較される。
コミュニティの視点と反論
技術およびアーカイブコミュニティ間の議論は、この慣行の見方に分断があることを示している:
この慣行に対する反論
- 文化的抹消: 多くの人々はこれをアレクサンドリア図書館の焼書の現代版と見なし、「大きな忘却」と表現している。
- 倫理的懸念: 批評家は、マーケティングメール用のチャットボットを訓練するために書籍をシュレッダーにかけることは、人類の遺産の損失に対する正当化できないトレードオフだと主張している。
反論とニュアンス
- 著作権の抜け穴: 一部の人々はこれが過度に制限的な米国著作権法の直接的な結果だと主張している。彼らは、破壊的スキャンを必要とせずに AI のトレーニングが合法的に許可されれば、企業はこれらの方法に頼らないだろうと示唆している。
- 非希少書籍の対象: 一部の懐疑論者は、AI 企業が主に著作権下にあるが絶版となった書籍を対象とし、本当に代替不可能な古代の手稿については対象外だと示唆している。なぜなら後者は大量に取得するには高価すぎたり希少すぎたりするからである。
- 「アナログホール」: 一部の観察者は、物理書籍を購入してスキャンする方が、シャドウライブラリデータで訴えている出版社に高額なライセンス料を支払うよりも AI 企業にとってはるかに安価であると指摘している。
"我々は希少書籍をシュレッダーにかけ、NDA を提供して誰にも気づかれないようにする。これは 2026 年における正当なビジネスモデルである。"
既存のアーカイブ慣行との比較
一部のアーカイブ専門家は、「破壊的スキャン」(製本の切断)は新しいものではないが、ここでの重要な違いはその後にページをシュレッダーにかける点である。従来のアーカイブでは、切断されたページを密封されたプラスチック袋に無期限に保管し、再スキャンや保存を可能にすることが一般的である。それに対し、AI パイプラインは reportedly 、コスト効率のためにそれらを破棄している。