Cloudflare는 Search, Agent, Training 사용 사례에 대한 새로운 AI 트래픽 컨트롤을 도입합니다
Cloudflare는 Search, Agent, Training 사용 사례에 대한 새로운 AI 트래픽 컨트롤을 도입합니다
개요
Cloudflare는 Search, Agent, Training 크롤러에 대한 세분화된 AI 트래픽 컨트롤을 도입했으며, 광고를 표시하는 페이지에서 Training 및 Agent 봇을 차단하는 새로운 기본 설정을 도입하고, 모든 고객을 위한 BotBase 및 콘텐츠 사용 신호와 같은 가시성 도구를 추가했습니다.
AI 트래픽에 대한 실용적 분류
Cloudflare는 봇 행동을 기반으로 세 가지 핵심 AI 사용 사례를 정의합니다: Search (나중에 질문에 답변하기 위해 콘텐츠를 수집하거나 색인 생성), Agent (작업을 완료하기 위해 개인을 대신하여 실시간으로 행동), Training (모델을 훈련하거나 미세 조정하기 위해 콘텐츠를 크롤링). 봇은 이러한 행동 중 하나 이상으로 분류될 수 있으며, 이 분류는 운영자가 목적을 기준으로 크롤러를 분리하여 더 높은 투명성을 얻도록 장려합니다.
AI 트래픽 관리를 위한 새로운 컨트롤
고객은 이제 Search, Agent, Training 크롤러를 독립적으로 허용하거나 차단할 수 있습니다. 이러한 옵션은 이전의 단일 “AI 봇 차단” 프리셋을 대체하며, Free를 포함한 모든 Cloudflare 티어에서 사용할 수 있습니다. 컨트롤은 Bot Management 영역의 zone Settings에 표시됩니다.
2026년 9월 15일 효력 발생하는 새로운 기본 설정
Cloudflare에 온보딩되는 새로운 도메인에 대해, 광고를 표시하는 페이지에서는 Training 및 Agent 봇이 기본적으로 차단되며, Search는 기본적으로 허용됩니다. 그 이유는 광고가 수익화 가능한 인간 중심 페이지를 나타내므로, 해당 주의를 방해할 수 있는 봇이 제한되기 때문입니다. 다목적 크롤러(예: Googlebot, Applebot, BingBot)는 적용 가능한 가장 제한적인 규칙의 적용을 받게 되므로, 사이트 소유자가 Training을 차단하면 해당 크롤러는 Search도 수행하더라도 차단됩니다. 사이트 소유자는 2026년 9월 15일 이전에 Security 설정을 통해 이러한 기본 설정을 선택 해제할 수 있으며, Cloudflare는 upcoming 변경 사항에 대해 고객에게 알릴 것입니다.
엔터프라이즈를 위한 BotBase 가시성
엔터프라이즈 Bot Management 고객은 알려진 모든 봇(검증된 봇 및 에이전트 포함)의 검색 가능한 디렉터리인 BotBase를 받습니다. BotBase는 각 봇의 분류(Search, Agent, Training, Transact, 데이터 수집, 보안 테스트, SEO, 광고 검증, 소셜/링크 미리보기, 피드 가져오기, 모니터링 및 작업)를 보여주며, 사용자는 특정 봇별로 트래픽을 필터링하고, 탐지 ID를 복사하며, 보안 규칙을 생성할 수 있습니다. 이 기능은 Bot Management 구성 카드 내에서 라이브 상태입니다.
콘텐츠 사용 신호 및 robots.txt 확장
Cloudflare는 robots.txt에 use 신호를 추가하여 봇이 크롤링된 콘텐츠를 어떻게 저장하고 재공유할 수 있는지 나타냅니다: immediate (상호작용하지만 아무것도 저장하지 않음), reference (기본값; 색인, 추출, 링크 백), 또는 full (요약 및 재생산). 이 신호는 선택적 네 번째 필드를 가진 기존 Content Signals를 확장합니다. 이미 관리형 robots.txt를 사용하는 고객에게 Cloudflare는 자동으로 use=reference를 추가합니다. 선언된 사용 수준을 위반하는 봇은 Verified 상태를 잃을 수 있습니다.
업데이트된 Verified 봇 정의
Verified 라벨은 더 이상 “기본적으로 허용됨”을 의미하지 않습니다. 대신, Verified 봇은 분류된 카테고리에 대해서만 허용됩니다(예: Search가 허용된 경우 Verified Search 봇은 허용될 수 있음). 검증은 이제 운영자가 자신을 정직하게 대표하고 획득한 접근을 남용하지 않도록 요구합니다. Cloudflare는 운영자가 정확한 표현을 보장할 수 있도록 관리 도구를 구축하고 있습니다.
전이적 신뢰 실험
Cloudflare는 중개자를 통해 신뢰를 전파하기 위해 Forwarded 헤더(RFC 7239)를 사용하는 것을 제안합니다. 사이트 소유자의 선호도(예: 선택적 use= 매개변수가 있는 "이 운영자 허용))는 신뢰할 수 있는 프록시 계층을 통해 요청이 도착하더라도 존중됩니다. 이 접근 방식은 한계를 인정합니다: 개인 정보 보호 트래픽과 작은 소스는 혜택을 받지 못할 수 있으며, 그러한 경우에 프라이빗 레이트 limiting과 같은 대안이 제안됩니다.
커뮤니티 반응 (Hacker News 댓글)
댓글 작성자들은 여러 가지 영향과 우려를 지적했습니다:
- @simonw는 Google이 검색 인덱싱 및 Gemini 훈련에 동일한 크롤러 인프라를 사용하기 때문에, “학습 차단” 옵션을 활성화한 사이트의 경우 Googlebot이 2026년 9월 15일부터 차단될 것이라고 관찰했습니다.
- @tekacs는 이 조치를 "피곤하게 만든다"고 묘사했으며, Agent 봇이 동시에 차단됨에 따라 Cloudflare에서 에이전트를 구축하는 것이 모순적으로 느껴진다고 말했습니다.
- @guyn은 AI 훈련 차단이 Google 검색 봇도 차단함에 따라 그의 검색 트래픽이 절반으로 줄어들었다고 보고했습니다.
- @graeme는 pay‑per‑crawl 프로그램에 대한 업데이트를 요청했습니다.
- @zzzeek은 pay‑per‑crawl 링크가 여전히 "접근 요청" 버튼만 보여주고 누가 접근 권한이 있는지 표시하지 않아 불만을 표했습니다.
- @sneak은 기술적으로 색인을 허용하면서 훈련을 방지하는 것은 불가능하다고 주장하며, 그러한 주장을 하는 기술을 오해의 소지가 있다고 불렀습니다. 이러한 의견은 통제, 발견 가능성, 그리고 새로운 기본 설정이 검색 트래픽과 봇 생태계에 미치는 실제 영향 사이의 trade‑offs를 강조합니다.