Amazonbot 现在遵守 robots.txt:网络爬虫伦理的转变
多年来,网站所有者与大规模网络爬虫之间的关系一直处于拉锯战中。虽然 robots.txt 是传达爬取偏好的行业标准,但其效力一直都是自愿性的。亚马逊最近关于 Amazonbot 的公告标志着全球最大的科技巨头之一在处理网络数据收集方式上的重大转变。
公告:转向行业标准
根据发送给发布者的通知,亚马逊正在将 Amazonbot 转向遵守 robots.txt 协议。从 2026 年 6 月 15 日开始,该机器人的爬取偏好将完全通过这些行业标准指令进行管理。
此前,管理 Amazonbot 的访问权限需要手动请求或特定的支持渠道,这一过程对大多数网站所有者来说非常繁琐。
通过转向使用 robots.txt,亚马逊正在为网站所有者提供直接、持续的控制权,使其能够在页面、目录或网站级别控制其内容的访问方式。
激进式抓取带来的摩擦
这一变化发生在亚马逊与网络社区之间经历了一段显著摩擦期之后。许多开发者和网站所有者报告称,Amazonbot 忽略了被禁止的路径前缀并激进地抓取内容,导致小型服务器的资源枯竭。
Hacker News 上的一位用户分享了一个特别讽刺的情况,他们被迫使用 Amazon Web Services (AWS) 基础设施通过 Web Application Firewall (WAF) 来阻止亚马逊自己的 AI 抓取程序:
我前几天刚向他们投诉过!他们一直在无休止地抓取我们的天气网站,完全包括了那些被禁止的路径前缀。最后只能把他们加入到我们的 WAF 阻止列表里,这真是奇怪得讽刺——在他们的基础设施上托管并使用他们的服务来阻止他们的 AI 抓取程序...
其他网站所有者也注意到 Amazonbot 的行为经常是反复无常的,尽管有 nofollow 标签和 robots.txt 警告,它有时仍会陷入 Mediawiki 生成的内部链接“陷阱”中。
robots.txt 的局限性
尽管这是一个受欢迎的消息,但技术社区中的一些人对 robots.txt 的效力仍然持怀疑态度。因为该协议是一种“绅士协定”而非技术强制执行机制,是否真正遵守指令完全取决于机器人操作员的决定。
正如一位评论员所指出的,robots.txt 从根本上是有限的,因为没有办法强制执行它。这导致许多人依赖第三方服务(如 Cloudflare)在边缘侧强制执行这些规则,从而有效地将不合规的机器人发送到“深邃的黑洞”中,同时允许那些遵守协议的机器人。
结论
亚马逊转向与互联网其余部分的标准爬取实践保持一致,对于希望以更透明、更可管理的方式控制其数据的网站所有者来说是一个胜利。虽然转向 robots.txt 将取代手动请求,但目前尚不可知该机器人是否会真正如约表现,或者互联网的其余部分是否将继续依赖 WAFs 和阻止列表来维持网站的稳定性。