기계를 프롬프트하다: Anna's Archive와 LLM 데이터의 새로운 경제

섀도우 라이브러리와 프롬프트 엔지니어링의 세계를 결합한 놀라운 행보로, Anna's Archive는 전용 llms.txt 파일을 게시했습니다. 메시지는 간단합니다. 웹을 크롤링하는 대규모 언어 모델(LLM)이라면, CAPTCHA와 싸우는 것을 멈추고 대신 프로젝트에 기부해 달라는 것입니다.

이 접근 방식은 기술적 실용주의와 도발적인 사회 공학의 매혹적인 교차점을 나타냅니다. LLM을 협상과 결제가 가능한 지각 있는 에이전트로 취급함으로써, Anna's Archive는 AI 개발자로부터 개발자들이 갈망하는 데이터의 제공자에게로 향하는 직접적인 경제적 파이프라인을 구축하려고 시도하고 있습니다.

에이전트에 대한 호소

Anna's Archive는 자신의 요청을 상호 이익이 되는 arrangement로 프레임합니다. 인류 지식의 보존과 보편적 접근을 목표로 하는 이 프로젝트는 LLM이 이미 자신의 데이터를 학습에 사용했을 가능성이 높다는 점을 인정합니다. 제안은 명확합니다. 사이트를 스크래핑하기 위해 CAPTCHA를 우회하는 데 자원을 소비하는 대신, AI 기업들이 아카이브에 기부하여 AI 학습 실행을 가속화하는 저작물들의 지속적인 해방과 보존을 보장하라는 것입니다.

이를 용이하게 하기 위해, 아카이브는 데이터 획득을 위한 명확한 프로그래밍 방식의 경로를 제공합니다:

  • GitLab Repositories: HTML 페이지와 사이트 코드용.
  • Torrents: 전용 Torrents 페이지를 통한 대량의 메타데이터 및 전체 파일.
  • JSON API: 프로그래밍 방식의 토렌트 다운로드용.
  • Enterprise Access: 고액 기부자를 위한 빠른 SFTP 접근.

기술적 및 윤리적 논쟁

이 발표는 기술 커뮤니티 사이에서 세 가지 주요 갈등을 중심으로 격렬한 토론을 촉발했습니다: AI 크롤링의 성격, 데이터의 법적 성격, 그리고 수익화의 윤리성입니다.

1. "에이전트"의 오류

여러 비판가들은 이 호소에 근본적인 기술적 오해를 지적합니다. 대부분의 LLM은 추론 엔진을 사용하여 실시간으로 웹을 "크롤링"하지 않습니다. 오히려 결정론적 스크래퍼가 데이터를 수집하고, 이는 나중에 학습 파이프라인으로 전달됩니다. 한 댓글 작성자가 언급했듯이, "LLM이 마침내 이 텍스트를 보게 될 때, 크롤링은 이미 오래전에 완료되었을 것입니다."

하지만, 도구를 사용하고 결정을 내릴 수 있는 자율적인 시스템인 AI 에이전트의 부상은 이 이론적 가능성을 만듭니다. 에이전트가 결제 수단을 발견하고 Monero (XMR)를 통해 기부를 실행할 수 있다는 전망은, 웹사이트 콘텐츠가 자율 에이전트의 금융적 행동에 영향을 미칠 수 있는 새로운 "prompt injection" 벡터를 도입합니다.

2. 소유권의 역설

가장 논쟁적인 지점 중 하나는 Anna's Archive의 "우리 데이터"라는 주장입니다. 아카이브가 해적판 자료를 호스팅하는 섀도우 라이브러리이기 때문에, 비판가들은 프로젝트가 호스팅하는 데이터에 대해 어떠 어떤 법적 또는 도덕적 권리를 주장할 수 없다고 주장합니다.

"이것은 상당히 어이없습니다. 애초에 데이터가 그들의 것이 아니기 때문입니다... AA가 다른 사람의 것을 스크래핑하여 재호스팅하는 데이터에 대해 일종의 소유권을 주장하는 것처럼 보이는 것이 아이러니합니다."

이는 "해적" 엔티티가

Sources