管理机器人流量:一个机器人访客占比 99% 的网站所带来的教训
现代机器人流量的规模
对于许多独立网站运营者来说,机器人流量已从背景噪音演变为服务器请求的主要来源,其占比往往超过总流量的 99%。这一转变是由激进的 AI 爬虫、搜索引擎索引器以及分布式机器人网络驱动的,这些因素会污染分析数据、推高基础设施成本并降低真实人类用户的体验。
财务与运营影响
高额的机器人流量会带来直接的财务风险,特别是对于使用按需计费模式的网站。
- 基础设施成本激增: 自动化爬虫可能会触发资源消耗的大规模激增。一位运营者报告称,由于机器人活动冲击 Cloudflare D1 数据库,其每月成本增加了 500%。
- 分析数据污染: 当机器人占据绝大多数请求时,几乎无法从访客统计数据中获取有意义的业务洞察,从而掩盖了真实人类用户的行为。
- 资源枯竭: 小规模托管环境(例如每月 5 美元的 VPS 实例或基于 CGI 的托管)很容易被 AI 机器人淹没,导致内存枯竭和网站不稳定。
机器人缓解策略
网站所有者采用各种技术来过滤机器人流量,从托管服务到手动服务器级拦截。
托管安全服务
Cloudflare 是缓解机器人流量的主要工具,提供 AI 机器人拦截和验证页面等功能。然而,这种方法也存在权衡:
- 用户摩擦: “验证您是人类”的挑战可能会增加延迟并让合法用户感到沮丧。
- 中心化: 依赖单一提供商进行访问控制会产生依赖性,即由提供商的算法决定谁可以查看内容。
技术过滤技术
对于那些避免使用托管服务或需要更细粒度控制的人来说,存在几种技术替代方案:
- PoW (Proof of Work): 像 Anubis 这样的工具使用工作量证明挑战来区分真实的浏览器软件与简单的脚本,而无需依赖 user-agent 字符串。
- TLS 指纹识别: 分析 JA4 哈希值可以帮助识别那些模仿浏览器 user-agents 但使用非标准 TLS 指纹的住宅机器人网络。
- 地理拦截与 ASN 过滤: 拦截来自特定国家或数据中心 ASN(例如 AWS)的流量可以消除大部分自动化流量,尽管这存在拦截海外旅行或使用云工作站的合法用户的风险。
- IP 速率限制: 通过
iptables实现脚本来识别并拦截访问量最高的 IP 或 /24 子网,可以缓解激进的爬虫。
架构变更
改变网站的提供方式可以从根本上减少机器人的攻击面:
- 静态网站生成: 从动态数据库转向静态文件(例如 GitHub Pages)可以消除数据库驱动的成本激增风险,并降低服务器负载。
- 身份验证墙: 将高价值内容置于登录墙之后,允许运营者在账户级别而非 IP 级别跟踪异常活动。
开放性与保护之间的冲突
激进的爬虫行为兴起,在开放网络理想与网站保护的必要性之间造成了紧张关系。
“User Agent”光谱
“机器人”与“用户”之间的界限正在变得模糊。使用浏览器的人类是用户;使用专用浏览器(如 Zen 或 Brave)的人类仍然是用户;使用 Python 脚本 (BeautifulSoup) 来收集数据的人类是机器人,但仍然是人类驱动的请求。拦截所有机器人可能会在无意中惩罚那些利用自动化进行合法信息检索的进阶用户。
AI 爬虫与价值提取
AI 机器人,例如 Claude-SearchBot,以高容量爬取且极少产生引荐流量而闻名。这造成了一种感知上的价值不平衡:AI 模型基于爬取的数据向用户提供答案,却不向原始内容创作者回流流量。
"Claude-SearchBot 单独就抓取了约 205,000 个页面。仅发送了 1 个引荐流量... 很难不让人觉得有些被骗了,因为 Claude 能向其用户宣称 'Found it!',而我却没得到任何信用或补偿。"
Web 发现的未来
一些观察者认为,“机器人末日”可能会导致开放网络的终结,转而向“私有围墙花园”转型,即网站被设置为 noindex,并且只能通过来自信任人类的直接引荐来发现。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch