Amazonbot 및 Robots.txt 표준: 오래된 전환

수년간, 웹사이트 소유자와 대규모 웹 크롤러 간의 관계는 협력과 갈등 사이의 미묘한 균형을 이루어 왔습니다. 이 긴장의 중심에는 크롤링 선호도를 전달하기 위한 업계 표준 프로토콜인 robots.txt가 있습니다. 오랫동안 Amazon의 웹 크롤러인 Amazonbot은 이러한 지시를 무시하는 것으로 악명이 높았으며, 개발자들은 서버 자원을 보호하기 위해 극단적인 조치를 취해야 했습니다.

최근 업데이트에서 Amazon은 2026년 6월 15일부터 Amazonbot이 이러한 업계 표준 지시만을 통해 크롤링 선호도를 관리하도록 전환할 것임을 공식적으로 사용자에게 알렸습니다. 이 전환은 Amazon이 웹에 접근하는 방식에 중대한 변화를 의미하며, 수동 요청에서 탈피해 분산되고 표준화된 접근 방식으로 나아가게 됩니다.

표준화된 제어로의 전환

Amazon Publisher Support의 공식 커뮤니케이션에 따르면, 회사는 사이트 소유자가 Amazonbot이 귀하의 사이트에 접근하는 방식을 “직접적이고 지속적인 제어” 할 수 있는 시스템으로 이동하고 있습니다. 이를 통해 관리자는 표준 robots.txt 구문을 사용하여 페이지, 디렉터리 또는 사이트 수준에서 접근을 관리할 수 있습니다.

robots.txt 파일을 아직 구현하지 않은 경우, Amazon은 봇이 사이트에 접근할 때 “표준 웹 크롤링 관행”을 계속 따를 것이라고 밝혔습니다. 이는 봇이 이제 robots.txt 파일에 지정된 거부를 존중하지만, 파일이 전혀 없는 사이트에 대한 크롤링을 중단하지는 않을 것임을 의미합니다.

비준수의 비용

robots.txt로의 전환은 많은 중소 규모 사이트 소유자에게 상당한 운영 부담을 초래한 공격적인 스크래핑 기간 이후에 이루어졌습니다. 이번 발표와 관련된 커뮤니티 논의는 Amazonbot의 이전 행동으로 인한 피해 규모를 보여줍니다:

  • Resource Exhaustion: 일부 사용자는 봇으로부터 엄청난 양의 트래픽이 발생했다고 보고했습니다. 한 사용자는 Amazonbot이 한 달 동안 공개 리포지토리로 750 GiB의 트래픽을 사용했다고 주장했다고 언급했습니다.
  • Infrastructure Irony: 여러 개발자는 AWS 인프라에 사이트를 호스팅하면서 AWS WAF(웹 애플리케이션 방화벽)를 사용해 Amazon 자체 AI 스크래퍼를 차단하는 아이러니를 지적했습니다.
  • Inefficient Crawling: 일부 사이트 소유자는 봇이 루프에 “갇혀” nofollow 태그를 무시하고 내부 페이지 변형을 대량으로 요청하여 서버에 자가 발생 DDoS 공격을 일으킨다고 보고했습니다.

“신사의 합의” 문제

긍정적인 소식에도 불구하고, 기술 커뮤니티의 많은 사람들은 여전히 회의적입니다. 핵심 문제는 robots.txt가 기술적인 강제 메커니즘이 아니라 “신사의 합의”에 불과하다는 점입니다. 한 댓글자는 “현재 robots.txt는 단지 신사의 예의일 뿐이며, 이를 따를 의무는 누구에게도 없습니다.”라고 언급했습니다.

프로토콜이 자발적이기 때문에, 사이트 소유자들은 Anubis나 Cloudflare의 봇 관리 시스템과 같은 도구에 의존해 크롤러를 강제로 차단해야 했습니다. 예를 들어 Cloudflare는 robots.txt를 존중하면서 악의적이거나 비준수 봇을 “깊은 블랙홀”로 라우팅하는 메커니즘을 제공합니다.

AI 크롤러에 대한 광범위한 함의

Amazon의 이번 조치는 AI 기업들이 대규모 언어 모델(LLM) 훈련을 위해 웹을 공격적으로 스크래핑하는 더 큰 추세의 일부입니다. 콘텐츠 제작자 생태계와 데이터를 수집하는 주체 간의 마찰이 끓어오르고 있습니다.

“자기 이익을 위한” 크롤링의 윤리에 대한 의문이 제기되었습니다—예를 들어 Amazon과 같은 기업이 자체 클라우드 인프라(AWS)에서 호스팅된 웹사이트를 크롤링함으로써 사이트 소유자의 사용 비용을 증가시키면서, 크롤러는 데이터를 자체 이익을 위해 수집할 수 있습니다.

결론

robots.txt를 존중하는 조치는 더 나은 웹 시민성을 위한 환영받는 단계이지만, 사이트가 크롤링되지 않도록 보장하는 유일한 방법은 방화벽 수준에서 강력히 차단하는 것이라는 현실이 남아 있습니다. 개발자와 사이트 관리자를 위한 교훈은 명확합니다: 행동이 좋은 봇을 위해 robots.txt를 사용하되, 공격적인 봇을 대비해 WAF 규칙을 최신 상태로 유지하십시오.

SUMMARY: Amazon은 Amazonbot이 마침내 robots.txt 지시를 존중할 것이라고 발표했으며, 많은 사이트 소유자들이 맞춤 차단 도구를 구현하도록 강요받았던 공격적인 스크래핑 기간을 종료합니다.

TITLE: Amazonbot 및 Robots.txt 표준: 오래된 전환

Sources