AI 봇 스푸핑과 에이전틱 웹의 현황

AI 도구 설정을 겨냥한 AI 봇 스푸핑 캠페인

현재 웹 전반에 걸쳐 대규모 취약점 스캔을 수행하기 위해 AI 봇을 사칭하는 활발한 위협 캠페인이 진행 중입니다. Known Agents의 데이터에 따르면, 공격자들은 ClaudeBot 및 GPTBot을 포함한 알려진 AI 에이전트 신원을 사칭하여 단순 필터를 우회하고 AI 코딩 도구에서 사용하는 특정 자격 증명 및 설정 경로를 타겟팅하고 있습니다.

타겟 취약점

이 캠페인은 민감한 API 키, 환경 변수 및 설정 값이 포함될 수 있는 파일과 디렉토리를 구체적으로 겨냥합니다. 우선순위가 높은 타겟은 다음과 같습니다:

  • AI 도구 설정: /.config/anthropic/credentials/default.json, /.claude/settings.json, /.claude.json, /.aider.conf.yml, 및 /.continue/config.json.
  • 환경 파일: /.env, /.env.local, /.env.production, 및 /.env.backup.
  • 클라우드 자격 증명: /.aws/credentials, /.aws/config, /service-account.json, 및 /firebase-adminsdk.json.
  • 인프라 파일: /docker-compose.yaml, /terraform.tfstate, 및 /.docker/config.json.

탐지 및 완화

User-Agent 문자열은 쉽게 조작될 수 있기 때문에, 보안 전문가들은 User-Agent가 신원을 확인하는 신뢰할 수 있는 대리 수단이 아니라고 강조합니다. 이러한 공격을 완화하기 위해 관리자는 다음과 같이 해야 합니다:

  1. Reverse DNS 또는 IP 범위로 검증: 합법적인 AI 크롤러는 일반적으로 IP 범위를 공개하거나 reverse DNS 검증을 지원합니다.
  2. Web Bot Auth 구현: Google의 Web Bot Auth와 같은 신흥 표준은 단순한 헤더를 넘어 크롤러 인증을 위한 더 안전한 방법을 제공하는 것을 목표로 합니다.
  3. 환경 강화: 모든 스푸핑된 IP를 차단하는 대신, 실제 타겟 경로를 보호하는 데 집중하십시오 (예: .env 파일이 웹에서 접근 가능하지 않도록 보장).

"많은 목록에 있는 user-agents는 종종 조작됩니다. 해당 IP를 소유한 ASN을 확인하십시오. 대부분의 VPS 제공업체를 차단하면 대부분의 조작된 봇이 사라집니다."

에이전틱 웹의 현황: 트래픽 트렌드

5,000개 이상의 웹사이트를 모니터링하는 Agentic Web Index의 데이터는 웹 접속 방식의 중대한한 변화를 보여줍니다. "Agentrification"—AI 관련 봇 트래픽의 비율—이 지난 90일 동안 11% 증가하여, 현재 전체 봇 트래픽의 28%를 차지하고 있습니다.

AI 스크래핑 및 데이터 수집

AI 데이터 스크래퍼(LLM 학습을 위해 콘텐츠를 다운로드하는 봇)는 AI 활동의 거대한 부분을 차지합니다. ClaudeBot은 이 카테고리에서 가장 활발하며, AI 스크래핑 트래픽의 27%를 차지하고, 그 뒤를 meta-externalagent (19.5%)와 Amazonbot (19.2%)이 잇고 있습니다.

AI 페칭(Fetching) 및 RAG

AI 어시스턴트와 코딩 에이전트는 실시간 검색 증강 생성(RAG)을 지원하기 위해 "fetching"을 사용합니다. 이 트래픽은 ChatGPT-User가 주도하고 있으며, 전체 AI 페칭 활동의 86.4%를 차지합니다. 이러한 봇들은 주로 사용자에게 실시간 답변을 제공하기 위해 참조, 과학, 금융 카테고리를 타겟팅합니다.

AI 검색 인덱싱

AI 검색 크롤러는 AI 기반 검색 결과에서 인용을 제공하기 위해 콘텐츠를를 인덱싱합니다. PetalBot (25.4%)과 Amzn-SearchBot (17.3%)은 현재 이 분야에서 가장 활발한 에이전트입니다.

Robots.txt 준수 및 효과성

robots.txt 규칙의 전반적인 효과성은 98.5%로 높지만, 유명한 봇들이 몇 가지 눈에 띄는 예외를 있습니다.

준수 격차

특정 봇들은 더 낮은 효과성 점수를 보여줍니다. 이는 disallow 규칙에 의해 차단된 후에도 트래픽를 줄이는 데 덜 효과적임을 의미합니다. 주목할 만한 규칙 위반자는 다음과 같습니다:

  • Baiduspider: 82.6% 효과성
  • SirdataBot: 84.5% 효과성
  • ShapBot: 90.4% 효과성

가장 많이 차단된 에이전트

웹사이트 관리자들은 AI 학습용 봇을 가장 공격적으로 차단하고 있습니다. 상위 1,000개 웹사이트에서 GPTBot (24.6%), CCBot (22.6%), 및 ClaudeBot (21.7%)이 가장 빈번하게 차단되는 에이전트입니다.

봇 트래픽에 대한 커뮤니티의 관점

개발자와 시스템 관리자들 사이의 기술적 논의는 이를 새로운 위협으로 보는 이들과 기존의 "background noise"의 진화로 보는 이들 사이의 분열을 시정을합니다.

"Water is Wet" 관점

많은 숙련된 관리자들은 대규모 취약점 스캔은 인터넷의 영구적인 상태라고 주장합니다. AI 봇 스푸핑은 수십 년 동안 WordPress 로그인 페이지를 타겟팅해 온 것과 동일한 유형의 스캔을 위한 새로운 기만술의 층위일 뿐입니다.

능동적 차단의 위험성

일부 개발자들은 공격적인 봇 차단 모드(일부 CDN이 제공하는 방식)가 역효과를 낼 수 있다고 경고합니다. 과도한 차단은 "crawling budget" 낭비를 초래할 수 있으며, Google이나 Bing과 같은 합법적인 검색 엔진이 실수로 차단되어 사이트의 SEO와 가시성을 해칠 수 있습니다.

Sources

관련