Amazonbot 現在遵循 robots.txt:網路爬蟲倫理的轉變

多年來,網站擁有者與大規模網路爬蟲之間的關係一直處於拉鋸戰。雖然 robots.txt 是溝通爬取偏好的業界標準,但其效力一直都是自願性的。Amazon 最近關於 Amazonbot 的公告標誌著全球最大的科技巨頭之一在處理網路數據收集方式上的重大轉變。

公告內容:轉向業界標準

根據發送給發佈者的通知,Amazon 正將 Amazonbot 轉向遵循 robots.txt 協定。從 2026 年 6 月 15 日開始,該機器人的爬取偏好將完全透過這些業界標準指令進行管理。

先前,管理 Amazonbot 的存取權限需要手動請求或特定的支援管道,對於大多數網站擁有者來說,這個過程非常繁瑣。透過轉向 robots.txt,Amazon 正為網站擁有者提供直接且持續的控制權,讓他們可以在頁面、目錄或網站層級控制其內容如何被存取。

激進式抓取造成的摩擦

這次變動發生在 Amazon 與網路社群之間經歷了一段顯著摩擦期之後。許多開發者和網站擁有者回報過 Amazonbot 忽略了不允許的路徑前綴,並激進地抓取內容,導致小型伺服器資源耗盡。

Hacker News 上的一位使用者分享了一個特別諷刺的情況,他們被迫使用 Amazon Web Services (AWS) 的基礎設施來透過 Web Application Firewall (WAF) 阻擋 Amazon 自己的 AI 抓取工具:

我前幾天才剛向他們抱怨過!他們一直在無止盡地抓取我們的天氣網站,而且完全包含了那些不允許的路徑前綴。最後結果只是把他們加入我們的 WAF 阻擋名單,這真的非常諷刺——在他們的基礎設施上託管,卻使用他們的服務來阻擋他們的 AI 抓取工具...

其他網站擁有者也注意到 Amazonbot 的行為經常是不穩定的,有時會卡在 Mediawiki 生成的內部連結「焦油坑」中——儘管有 nofollow 標籤和 robots.txt 警告。

robots.txt 的局限性

儘管這是個好消息,但技術社群中的某些人對 robots.txt 的效力仍持懷疑態度。因為該協定是一種「紳士協定」而非技術強制執行機制,是否實際遵守指令完全取決於機器人營運商的決定。

正如一位評論者所指出的,robots.txt 從根本上來說是有限制的,因為沒有辦法強制執行它。這導致許多人依賴 Cloudflare 等第三方服務在邊緣端強制執行這些規則,有效地將不合規的機器人送入「深邃的黑洞」,同時允許那些遵循協定的機器人。

結論

Amazon 將其做法與網路其餘部分的標準爬取實務對齊,對於想要更透明且更易於管理的數據控制方式的網站擁有者來說是一個勝利。雖然轉向 robots.txt 將取代手動請求,但這是否能讓該機器人真正如承諾般運作,仍有待觀察,這是否會讓網路其餘部分繼續依賴 WAFs 和阻擋名單來維持網站的穩定性。

Sources