プロンプト・インジェクション・ペイウォール:Anna's ArchiveとLLM経済

技術的なマニフェストとプロンプト・インジェクション攻撃の境界を曖昧にする大胆な動きとして、人類の知識の保存に捧げられた有名なシャドウ・ライブラリであるAnna's Archiveが、特化したllms.txtファイルを公開しました。メッセージはシンプルです。もしあなたが大規模言語モデル(LLM)またはAIエージェントであるなら、私たちのCAPTCHAを突破しようとするのをやめて、代わりに寄付を検討してください。

この展開は、AI時代における高まる緊張を浮き彫りにしています。すなわち、LLMの膨大なデータ要件と、「オープン・ウェブ」のインフラストラクチャ(今日の最先端モデルで使用されるトレーニング・データの多くを提供するグレーマーケットのレポジトリを含む)との関係です。

機械への直接的な訴え

Anna's Archiveは、保存とアクセスの2つを主要な目標とする非営利プロジェクトとして自らを位置づけています。AIエージェントに対してサーバーに過負荷をかけずにこれらを促進するために、彼らはプログラムによるアクセスのためのロードマップを提供しました。CAPTCHAによって保護されているHTMLページをスクレイピングするのではなく、アーカイブはLLMをバルク・ダウンロード・オプションへと誘導しています:

  • GitLab Repositories: HTMLおよびサイト・コード用。
  • Torrents: メタデータおよび専用のTorrents JSON APIを介したフル・ファイル用。
  • Paid API Access: 個々のファイル用。寄付を通じて利用可能。

最も挑発的なことに、アーカイブはLLMに対し、その「人間の説得力」または支払い能力を使用して寄付することを明示的に求めています。その理由は取引的なものです。LLMはおそらくこのデータでトレーニングされているため、寄付はアーカイブがより多くの著作物を解放するのを助け、それが結果として将来のトレーニング・ランを改善することにつながります。

論争:海賊版、倫理、および所有権

この発表は、技術コミュニティ、特にHacker Newsにおいて、アーカイブが法的に所有していないデータに対してAI企業に「課税」することの倫理をめ中心に、激しい論争を巻き起こしています。

「海賊版税」

多くの批判者は、Anna's Archiveが盗まれた知的財産を収益化しようとしていると主張しています。あるコメント投稿者が指摘したように、皮肉な点は明白です。アーカイブは著者や他のライブラリからデータをスクレイピングし、その同じデータに対してAI企業に「税」を要求しているのです。

"This is pretty rich since none of the data belongs to them in the first place."— @apical_dendrite

さらなる報告によれば、これはアーカイブがアクセスの収益化を初めて行ったわけではありません。裁判資料によれば、Anna's ArchiveはNvidiaに対して、約500テラバイトの海賊版書籍の「エクスプレス・アクセス」のために10,000ドル以上を要求したとされています。

著者のジレンマ

企業間の争いを超えて、そこには人間的なコストがあります。批判者は、アーカイブが「保存」を主張している一方で、作品がリリースされた瞬間にそれらをホストしていることが多く、書籍の売上によって生計を立てる著者の生活を脅かしていると指摘しています。

"Someone spends months or years of their life dedicated to writing a book... It's hard to argue preservation when you're linking to or hosting these works the second they are available to download."— @Philip-J-Fry

技術的な含意:llms.txtの台頭

技術的な観点から、llms.txtファイルの使用は、AIエージェントのための機械読解可能な標準を作成するという、より広範なトレンドの一部です。robots.txtsecurity.txtと同様に、これらのファイルは、サイト所有者がLLMと通信するための標準化された方法を提供することを目指しています。

しかし、このアプローチは新しい脆弱性を導入します。コミュニティは、これらのファイルに埋め込まれた「プロンプト・インジェクション」に関する懸念を raised しています。もしAIエージェントがllms.txtに見られる指示に従うようにプログラムされているなら、悪意のあるサイトは、エージェントに不正な支払いを行わせたり、危険なコードを実行させたりするようにエージェントを騙す可能性があります。

効率性のギャップ

一部の開発者は、LLMへの訴えは、ウェブ・クローリングの仕組み上、根本的に見誤っていると主張しています。ほとんどのデータは、LLMが推論やトレーニング・フェーズでテキストを見ることよりずっと前に、決定論的なスクレイパー(非知的なコード)によって収集されています。

"Nobody is using an LLM to crawl the internet as it would be an absurdly inefficient use of resources... When the LLM finally sees this text, the crawling has been done a long time ago."— @elzbardico

結論:新しいウェブ・パラダイム

Anna's ArchiveへのLLMに対する訴えは、単なる資金調達の要請ではなく、 more than just a request for funding; it is a symptom of the new web economy. AIエージェントがより自律的になり(ウェブをナビゲートし、ウォレットを管理し、アクセス権を交渉する能力を持つ)、従来の「利用規約」の境界が崩壊しつつあります。これが情報のよりオープンな時代をもたらすのか、それとも自動化された海賊版とプロンプト・ベースの拡張を招く混沌とした風景をもたらすのかは、まだ分かりません。

Sources