AI Bot 欺骗与智能体网络现状

AI Bot 欺骗活动瞄准 AI 工具配置

一场活跃的威胁活动目前正在冒充 AI 机器人,在整个网络中进行大规模漏洞扫描。根据 Known Agents 的数据,攻击者正在伪造已知的 AI 智能体身份——包括 ClaudeBot 和 GPTBot——以绕过简单的过滤器,并针对 AI 编程工具使用的特定凭据和配置路径。

针对的漏洞

该活动专门针对可能包含敏感 API 密钥、环境变量和配置设置的文件和目录。高优先级目标包括:

  • AI 工具配置: /.config/anthropic/credentials/default.json/.claude/settings.json/.claude.json/.aider.conf.yml/.continue/config.json
  • 环境文件: /.env/.env.local/.env.production/.env.backup
  • 云凭据: /.aws/credentials/.aws/config/service-account.json/firebase-adminsdk.json
  • 基础设施文件: /docker-compose.yaml/terraform.tfstate/.docker/config.json

检测与缓解

由于 User-Agent 字符串极易伪造,安全专家强调 User-Agent 并不是身份的可靠代理。为了缓解这些攻击,管理员应当:

  1. 通过反向 DNS 或 IP 范围进行验证: 合法的 AI 爬虫通常会发布其 IP 范围或支持反向 DNS 验证。
  2. 实施 Web Bot 身份验证: 像 Google 的 Web Bot Auth 这样新兴的标准旨在提供比简单标头更安全的爬虫身份验证方法。
  3. 强化环境: 重点在于保护实际的目标路径(例如,确保 .env 文件不会被 Web 访问),而不是试图阻止每一个伪造的 IP。

"Many of those user-agents listed are often faked. Look up which ASN owns their IP. If I block most VPS providers most of the faked bots vanish."

智能体网络现状:流量趋势

来自 Agentic Web Index 的数据(该指数监测超过 5,000 个网站)揭示了网络访问方式的重大转变。“智能体化”(Agentrification)——即机器人流量中与 AI 相关的百分比——在过去 90 天内增长了 11%,目前占所有机器人流量的 28%。

AI 抓取与数据收集

AI 数据抓取器(为 LLM 训练下载内容的机器人)占据了 AI 活动的巨大份额。ClaudeBot 在此类别中最活跃,占 AI 抓取流量的 27%,其次是 meta-externalagent (19.5%) 和 Amazonbot (19.2%)。

AI 获取与 RAG

AI 助手和编程智能体使用“获取”(fetching)来驱动实时的检索增强生成 (RAG)。这类流量由 ChatGPT-User 主导,占所有 AI 获取活动的 86.4%。这些机器人主要针对参考、科学和金融类别,以为用户提供实时答案。

AI 搜索索引

AI 搜索爬虫索引内容,以便在 AI 驱动的搜索结果中提供引用。PetalBot (25.4%) 和 Amzn-SearchBot (17.3%) 是目前该领域最活跃的智能体。

Robots.txt 的合规性与有效性

虽然 robots.txt 规则的整体有效性高达 98.5%,但在知名机器人中存在显著例外。

合规差距

某些机器人的有效性得分较低,这意味着它们在被 disallow 规则拦截后,减少流量的可能性较低。显著的违规者包括:

  • Baiduspider: 82.6% 有效性
  • SirdataBot: 84.5% 有效性
  • ShapBot: 90.4% 有效性

被拦截最多的智能体

网站管理员正在最激进地拦截 AI 训练机器人。在排名前 1,000 的网站中,GPTBot (24.6%)、CCBot (22.6%) 和 ClaudeBot (21.7%) 是被拦截最频繁的智能体。

社区对机器人流量的看法

开发者和系统管理员之间的技术讨论表明,观点存在分歧:一方认为这是一种新威胁,另一方则将其视为现有“背景噪音”的演变。

“水是湿的”观点

许多经验丰富的管理员认为,大规模漏洞扫描是互联网的一种常态。伪造 AI 机器人只是针对过去几十年一直针对 WordPress 登录页面的同类扫描的一种新伪装手段。

主动拦截的风险

一些开发者警告说,激进的机器人对抗模式(例如某些 CDN 提供的模式)可能会适得其反。过度拦截会导致“爬取预算”浪费,即 Google 或 Bing 等合法搜索引擎被意外拦截,从而损害网站的 SEO 和可见性。

Sources

相关