Cloudflare 推出针对 Search、Agent 和 Training 场景的新 AI 流量控制
Cloudflare 推出针对 Search、Agent 和 Training 场景的新 AI 流量控制
Overview
Cloudflare 推出了针对 Search、Agent 和 Training 爬虫的细粒度 AI 流量控制,引入了在显示广告的页面上阻止 Training 和 Agent 机器人的新默认设置,并为所有客户添加了诸如 BotBase 和内容使用信号之类的可见性工具。
Pragmatic Taxonomy for AI Traffic
Cloudflare 根据机器人行为定义了三个核心 AI 用例:Search(收集或索引内容以稍后回答问题)、Agent(代表个人实时行动以完成任务)和 Training(爬取内容以训练或微调模型)。机器人可能被归类为一种或多种这些行为,该分类法鼓励运营商按目的分离爬虫,以实现更高的透明度。
New Controls to Manage AI Traffic
客户现在可以独立允许或阻止 Search、Agent 和 Training 爬虫。这些选项取代了之前的单一“阻止 AI 机器人”预设,适用于所有 Cloudflare 层级,包括免费层。这些控制位于区域设置的 Bot Management 下。
New Defaults Effective September 15 2026
从 2026 年 9 月 15 日起生效的新默认设置:对于新加入 Cloudflare 的域名,在显示广告的页面上默认阻止 Training 和 Agent 机器人,而 Search 默认保持允许。其理由是广告表明这是一个可盈利的人类聚焦页面,因此可能干扰该注意力的机器人将受到限制。多用途爬虫(例如 Googlebot、Applebot、BingBot)将受到最严格适用规则的约束;因此,如果站点所有者阻止 Training,则即使这些爬虫也执行 Search,它们也将被阻止。站点所有者可以在 2026 年 9 月 15 日之前通过安全设置选择退出这些默认设置,Cloudflare 将通知客户即将发生的变更。
BotBase Visibility for Enterprise
企业 Bot Management 客户将获得 BotBase,这是一个可搜索的所有已知机器人目录,包括已验证的机器人和代理。BotBase 显示每个机器人的分类(Search, Agent, Training, Transact, Data Collection, Security Testing, SEO, Ads Verification, Social/Link Preview, Feed Fetching, Monitoring & Operations),并允许用户按特定机器人过滤流量、复制其检测 ID 并创建安全规则。该功能在 Bot Management 配置卡中已上线。
Content‑Use Signals and Robots.txt Extension
Cloudflare 在 robots.txt 中添加了一个 use 信号,用于指示机器人如何存储和重新共享爬取的内容:immediate(交互但不存储)、reference(默认;索引、摘要、反向链接)或 full(摘要并复制)。该信号在现有 Content Signals 的基础上扩展了一个可选的第四个字段。对于已经使用托管 robots.txt 的客户,Cloudflare 将自动追加 use=reference。违反声明使用级别的机器人可能会失去 Verified 状态。
Updated Verified Bot Definition
Verified 标签不再意味着“默认允许”。相反,只有在其被分类的类别中被允许的 Verified 机器人才可被允许(例如,如果 Search 被允许,则 Verified Search 机器人可能被允许)。验证现在要求运营商诚实地代表自己,并且不滥用所获得的访问权限。Cloudflare 正在构建管理工具,以帮助运营商确保准确的表示。
Transitive Trust Experiment
Cloudflare 提议使用 Forwarded 头(RFC 7239)通过中介传播信任。站点所有者的偏好(例如,带有可选 use= 参数的“允许此运营商”)即使请求经过多层受信任的代理也会被尊重。该方法承认其局限性:保护隐私的流量和小来源可能不会受益,并且对于这些情况,建议采用诸如私有速率限制之类的替代方案。
Community Reaction (Hacker News Comments)
评论者指出了若干影响和担忧:
- @simonw 观察到,对于启用了“阻止训练”选项的站点,Googlebot 将从 2026 年 9 月 15 日起被阻止,因为 Google 使用相同的爬虫基础设施进行搜索索引和 Gemini 训练。
- @tekacs 将此举描述为“筋疲力尽”,并表示鉴于同时阻止 Agent 机器人,在 Cloudflare 上构建代理会感觉矛盾。
- @guyn 报告称,阻止 AI 训练后他的搜索流量减半,这是因为它也阻止了 Google 搜索机器人。
- @graeme 要求更新按次付费爬取计划。
- @zzzeek 对按次付费爬取链接仍仅显示“请求访问”按钮而没有显示谁有访问权感到沮丧。
- @sneak 认为从技术上讲,不可能在允许索引的同时阻止训练,称任何声称能够做到这一点的技术都是误导性的。 这些言论凸显了在控制、可发现性以及新默认设置对搜索流量和机器人生态系统的实际影响之间的权衡。