AI Bot 欺騙與代理網路現狀

AI Bot 欺騙活動針對 AI 工具配置

一項活躍的威脅活動目前正在冒充 AI bot 以在網路上進行大規模漏洞掃描。根據 Known Agents 的數據,攻擊者正在偽造已知的 AI agent 身分——包括 ClaudeBot 和 GPTBot——以繞過簡單的過濾器,並針對 AI 編碼工具使用的特定憑證和配置路徑。

目標漏洞

該活動特別針對可能包含敏感 API keys、環境變數和配置設定的文件與目錄。高優先級的目標包括:

  • AI 工具配置: /.config/anthropic/credentials/default.json/.claude/settings.json/.claude.json/.aider.conf.yml/.continue/config.json
  • 環境文件: /.env/.env.local/.env.production/.env.backup
  • 雲端憑證: /.aws/credentials/.aws/config/service-account.json/firebase-adminsdk.json
  • 基礎設施文件: /docker-compose.yaml/terraform.tfstate/.docker/config.json

檢測與緩解措施

由於 User-Agent 字串很容易被偽造,安全專家強調 User-Agent 並非可靠的身分代理。為了緩解這些攻擊,管理員應:

  1. 透過反向 DNS 或 IP 範圍進行驗證: 合法的 AI 爬蟲通常會發布其 IP 範圍或支援反向 DNS 驗證。
  2. 實施 Web Bot 驗證: 新興標準如 Google 的 Web Bot Auth 旨在提供比簡單標頭更安全的爬蟲驗證方法。
  3. 強化環境安全性: 專注於保護實際的目標路徑(例如,確保 .env 文件不被網頁存取),而不是試圖封鎖所有偽造的 IP。

"許多列出的 user-agents 經常被偽造。查看哪個 ASN 擁有其 IP。如果我封鎖大多數 VPS 提供商,大部分偽造的 bot 就會消失。"

代理網路現狀:流量趨勢

來自監測超過 5,000 個網站的 Agentic Web Index 的數據顯示,網路存取方式發生了重大轉變。「代理化」(Agentrification)——即 AI 相關的 bot 流量百分比——在過去 90 天內增加了 11%,目前佔所有 bot 流量的 28%。

AI 抓取與數據收集

AI Data Scrapers(為 LLM 訓練下載內容的 bot)佔 AI 活動的巨大比例。ClaudeBot 在此類別中最活躍,佔 AI 抓取流量的 27%,其次是 meta-externalagent (19.5%) 和 Amazonbot (19.2%)。

AI 獲取與 RAG

AI Assistants 和 Coding Agents 使用「獲取」(fetching)來驅動即時的 Retrieval-Augmented Generation (RAG)。這類流量由 ChatGPT-User 主導,佔所有 AI 獲取活動的 86.4%。這些 bot 主要針對參考、科學和金融類別,以向用戶提供即時答案。

AI 搜尋索引

AI Search Crawlers 索引內容以在 AI 驅動的搜尋結果中提供引用。PetalBot (25.4%) 和 Amzn-SearchBot (17.3%) 是目前該領域中最活躍的 agent。

Robots.txt 合規性與有效性

雖然 robots.txt 規則的整體有效性很高,達到 98.5%,但在知名 bot 之間存在顯著的例外。

合規性差距

某些 bot 的有效性分數較低,這意味著在被 disallow 規則封鎖後,它們減少流量的可能性較低。值得注意的違規者包括:

  • Baiduspider: 82.6% 有效性
  • SirdataBot: 84.5% 有效性
  • ShapBot: 90.4% 有效性

最常被封鎖的 Agent

網站管理員正最積極地封鎖 AI 訓練 bot。GPTBot (24.6%)、CCBot (22.6%) 和 ClaudeBot (21.7%) 是在前 1,000 個網站中最常被封鎖的 agent。

社群對 Bot 流量的觀點

開發者和系統管理員之間的技術討論顯示,對於將此視為新威脅還是視為現有「背景噪音」的演進,存在分歧。

「水是濕的」觀點

許多經驗豐富的管理員認為,大規模漏洞掃描是網際網路的常態狀態。偽造 AI bot 的行為,僅僅是針對數十年來一直針對 WordPress 登入頁面的同類型掃描所採取的新型偽裝手段。

主動性封鎖的風險

一些開發者警告,激進的 bot 戰鬥模式(例如某些 CDN 提供的模式)可能會適得其反。過度封鎖可能導致「爬蟲預算」浪費,即 Google 或 Bing 等合法搜尋引擎被誤封,損害網站的 SEO 和能見度。

Sources

相關