Cloudflare 推出適用於 Search、Agent、Training 使用情境的新 AI 流量控制功能
Cloudflare 推出適用於 Search、Agent、Training 使用情境的新 AI 流量控制功能
總覽
Cloudflare 推出細緻的 AI 流量控制功能,適用於 Search、Agent、Training 爬蟲,並引入新的預設值,在顯示廣告的頁面上預設封鎖 Training 和 Agent 機器人,同時為所有客戶增添可見性工具,如 BotBase 和內容使用訊號。
AI 流量的實用分類法
Cloudflare 根據機器人行為定義三種核心 AI 使用情境:Search(收集或索引內容以稍後回答問題)、Agent(代表個人即時行動以完成任務)和 Training(爬取內容以訓練或微調模型)。機器人可能具備一種或多種這些行為,此分類法鼓勵運營者按目的區分爬蟲,以提高透明度。
新增控制功能以管理 AI 流量
客戶現在可以獨立允許或封鎖 Search、Agent、Training 爬蟲。這些選項取代先前的單一「封鎖 AI 機器人」預設值,並在所有 Cloudflare 方案中提供,包括 Free 方案。控制項位於區域設定的 Bot Management 下。
新預設值自 2026 年 9 月 15 日起生效
對於新加入 Cloudflare 的網域,在顯示廣告的頁面上,Training 和 Agent 機器人預設會被封鎖,而 Search 則預設允許。其理由是廣告表示這是可 monetize 的以人為中心的頁面,因此可能干擾該注意力的機器人會受到限制。多用途爬蟲(例如 Googlebot、Applebot、BingBot)將受到最嚴格適用規則的約束;因此,如果網站所有者封鎖 Training,則即使該爬蟲同時也執行 Search,也會被封鎖。 網站所有者可在 2026 年 9 月 15 日前透過 Security 設定選擇退出這些預設值,且 Cloudflare 會通知客戶即將到來的變更。
Enterprise 客戶的 BotBase 可見性
Enterprise Bot Management 客戶將獲得 BotBase,這是一個可搜尋的所有已知機器人目錄,包括已驗證的機器人和代理。BotBase 顯示每個機器人的分類(Search、Agent、Training、Transact、Data Collection、Security Testing、SEO、Ads Verification、Social/Link Preview、Feed Fetching、Monitoring & Operations),並允許使用者依特定機器人過濾流量、複製其偵測 ID,並建立安全規則。此功能已在 Bot Management 設定卡中上線。
內容使用訊號與 robots.txt 擴充
Cloudflare 在 robots.txt 中加入 use 訊號,以指示機器人可能如何存儲和重新分享爬取的內容:immediate(互動但不存儲任何內容)、reference(預設;索引、摘錄、反向連結)或 full(摘要並重製)。該訊號擴充了現有的 Content Signals,加入一個可選的第四欄位。對於已使用管理 robots.txt 的客戶,Cloudflare 會自動附加 use=reference。違反宣告使用等級的機器人可能會失去已驗證狀態。
已驗證機器人定義的更新
已驗證標籤不再代表「預設允許」。相反,已驗證機器人僅在其被分類的類別下才被允許(例如,若 Search 被允許,則已驗證的 Search 機器人可以被允許)。驗證現在要求運營者誠實代表自己,且不濫用所獲得的存取權。Cloudflare 正在建置管理工具,以協助運營者確保準確表達。
傳遞信任實驗
Cloudflare 提議使用 Forwarded header(RFC 7239)透過中介傳遞信任。網站所有者的偏好(例如,「允許此運營者」並可選擇性地加入 use= 參數)即使請求經過多層受信任的代理也會被尊重。該方法承認其限制:保護隱私的流量和小規模來源可能無法受益,並建議對此類情況使用私人速率限制等替代方案。
社區反應(Hacker News 評論)
評論者指出了數個影響與擔憂:
- @simonw 觀察到,對於啟用「封鎖 training」選項的網站,Googlebot 將從 2026 年 9 月 15 日起被封鎖,因為 Google 使用相同的爬蟲基礎設施進行搜尋索引和 Gemini 訓練。
- @tekacs 描述此舉為「令人疲憊」,並表示在 Cloudflare 上建構代理感覺矛盾,因為同時封鎖了 Agent 機器人。
- @guyn 報告說,封鎖 AI 訓練導致他的搜尋流量減少一半,因為同時也封鎖了 Google 搜尋機器人。
- @graeme 要求更新按次付費爬取計畫的進展。
- @zzzeek 對按次付費爬取連結仍僅顯示「請求存取」按鈕,且未顯示誰有存取權表示沮喪。
- @sneak 爭辯說,從技術角度來看,同時允許索引而阻止訓練在實務上是不可能的,任何聲稱能做到此事的技術都具有誤導性。
這些言論凸顯了在控制、可發現性以及新預設值對搜尋流量和機器人生態系統的實際影響之間的權衡。