Cloudflare는 Search, Agent, Training 사용 사례에 대한 새로운 AI 트래픽 컨트롤을 도입합니다
개요
Cloudflare는 Search, Agent, Training 크롤러에 대한 세분화된 AI 트래픽 컨트롤을 도입했으며, 광고를 표시하는 페이지에서 Training 및 Agent 봇을 차단하는 새로운 기본 설정을 도입하고, 모든 고객을 위한 BotBase 및 콘텐츠 사용 신호와 같은 가시성 도구를 추가했습니다.
AI 트래픽에 대한 실용적 분류
Cloudflare는 봇 행동을 기반으로 세 가지 핵심 AI 사용 사례를 정의합니다: Search (나중에 질문에 답변하기 위해 콘텐츠를 수집하거나 색인 생성), Agent (작업을 완료하기 위해 개인을 대신하여 실시간으로 행동), Training (모델을 훈련하거나 미세 조정하기 위해 콘텐츠를 크롤링). 봇은 이러한 행동 중 하나 이상으로 분류될 수 있으며, 이 분류는 운영자가 목적을 기준으로 크롤러를 분리하여 더 높은 투명성을 얻도록 장려합니다.
AI 트래픽 관리를 위한 새로운 컨트롤
고객은 이제 Search, Agent, Training 크롤러를 독립적으로 허용하거나 차단할 수 있습니다. 이러한 옵션은 이전의 단일 “AI 봇 차단” 프리셋을 대체하며, Free를 포함한 모든 Cloudflare 티어에서 사용할 수 있습니다. 컨트롤은 Bot Management 영역의 zone Settings에 표시됩니다.
2026년 9월 15일 효력 발생하는 새로운 기본 설정
Cloudflare에 온보딩되는 새로운 도메인에 대해, 광고를 표시하는 페이지에서는 Training 및 Agent 봇이 기본적으로 차단되며, Search는 기본적으로 허용됩니다. 그 이유는 광고가 수익화 가능한 인간 중심 페이지를 나타내므로, 해당 주의를 방해할 수 있는 봇이 제한되기 때문입니다. 다목적 크롤러(예: Googlebot, Applebot, BingBot)는 적용 가능한 가장 제한적인 규칙의 적용을 받게 되므로, 사이트 소유자가 Training을 차단하면 해당 크롤러는 Search도 수행하더라도 차단됩니다. 사이트 소유자는 2026년 9월 15일 이전에 Security 설정을 통해 이러한 기본 설정을 선택 해제할 수 있으며, Cloudflare는 upcoming 변경 사항에 대해 고객에게 알릴 것입니다.
엔터프라이즈를 위한 BotBase 가시성
엔터프라이즈 Bot Management 고객은 알려진 모든 봇(검증된 봇 및 에이전트 포함)의 검색 가능한 디렉터리인 BotBase를 받습니다. BotBase는 각 봇의 분류(Search, Agent, Training, Transact, 데이터 수집, 보안 테스트, SEO, 광고 검증, 소셜/링크 미리보기, 피드 가져오기, 모니터링 및 작업)를 보여주며, 사용자는 특정 봇별로 트래픽을 필터링하고, 탐지 ID를 복사하며, 보안 규칙을 생성할 수 있습니다. 이 기능은 Bot Management 구성 카드 내에서 라이브 상태입니다.
콘텐츠 사용 신호 및 robots.txt 확장
Cloudflare는 robots.txt에 use 신호를 추가하여 봇이 크롤링된 콘텐츠를 어떻게 저장하고 재공유할 수 있는지 나타냅니다: immediate (상호작용하지만 아무것도 저장하지 않음), reference (기본값; 색인, 추출, 링크 백), 또는 full (요약 및 재생산). 이 신호는 선택적 네 번째 필드를 가진 기존 Content Signals를 확장합니다. 이미 관리형 robots.txt를 사용하는 고객에게 Cloudflare는 자동으로 use=reference를 추가합니다. 선언된 사용 수준을 위반하는 봇은 Verified 상태를 잃을 수 있습니다.
업데이트된 Verified 봇 정의
Verified 라벨은 더 이상 “기본적으로 허용됨”을 의미하지 않습니다. 대신, Verified 봇은 분류된 카테고리에 대해서만 허용됩니다(예: Search가 허용된 경우 Verified Search 봇은 허용될 수 있음). 검증은 이제 운영자가 자신을 정직하게 대표하고 획득한 접근을 남용하지 않도록 요구합니다. Cloudflare는 운영자가 정확한 표현을 보장할 수 있도록 관리 도구를 구축하고 있습니다.
전이적 신뢰 실험
Cloudflare는 중개자를 통해 신뢰를 전파하기 위해 Forwarded 헤더(RFC 7239)를 사용하는 것을 제안합니다. 사이트 소유자의 선호도(예: 선택적 use= 매개변수가 있는 "이 운영자 허용))는 신뢰할 수 있는 프록시 계층을 통해 요청이 도착하더라도 존중됩니다. 이 접근 방식은 한계를 인정합니다: 개인 정보 보호 트래픽과 작은 소스는 혜택을 받지 못할 수 있으며, 그러한 경우에 프라이빗 레이트 limiting과 같은 대안이 제안됩니다.
커뮤니티 반응 (Hacker News 댓글)
댓글 작성자들은 여러 가지 영향과 우려를 지적했습니다:
- @simonw는 Google이 검색 인덱싱 및 Gemini 훈련에 동일한 크롤러 인프라를 사용하기 때문에, “학습 차단” 옵션을 활성화한 사이트의 경우 Googlebot이 2026년 9월 15일부터 차단될 것이라고 관찰했습니다.
- @tekacs는 이 조치를 "피곤하게 만든다"고 묘사했으며, Agent 봇이 동시에 차단됨에 따라 Cloudflare에서 에이전트를 구축하는 것이 모순적으로 느껴진다고 말했습니다.
- @guyn은 AI 훈련 차단이 Google 검색 봇도 차단함에 따라 그의 검색 트래픽이 절반으로 줄어들었다고 보고했습니다.
- @graeme는 pay‑per‑crawl 프로그램에 대한 업데이트를 요청했습니다.
- @zzzeek은 pay‑per‑crawl 링크가 여전히 "접근 요청" 버튼만 보여주고 누가 접근 권한이 있는지 표시하지 않아 불만을 표했습니다.
- @sneak은 기술적으로 색인을 허용하면서 훈련을 방지하는 것은 불가능하다고 주장하며, 그러한 주장을 하는 기술을 오해의 소지가 있다고 불렀습니다. 이러한 의견은 통제, 발견 가능성, 그리고 새로운 기본 설정이 검색 트래픽과 봇 생태계에 미치는 실제 영향 사이의 trade‑offs를 강조합니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch