社区里有人比官方时间表更早撞上了这件事。7 月初,一位站主开始看到经过验证的 Googlebot 请求收到 403,Cloudflare 的安全事件日志把这些请求标成 Blocked by “Block AI training crawlers”。他 8 月下旬在 Cloudflare 社区发帖求助。而 Cloudflare 官方给这套规则定的生效日期是 9 月 15 日,比他撞上的时间晚了两个月。
我把 Cloudflare 的官方博客、新闻稿和社区帖子对了一遍,整条线算是理清了。现在离 9 月 15 日只剩三周,正好是把设置查一遍的最后窗口。
规则本身不复杂。今年 7 月 1 日,Cloudflare 在第二届 Content Independence Day 上宣布,把 AI 爬虫按行为分成三类。Search 负责把页面收进索引,之后回答问题用;Agent 替人实时办事,比如聊天窗口的抓取和浏览器代理;Training 抓内容去训练或微调模型。三类可以分开放行或拦截,免费版也一样。9 月 15 日落地的是两条默认规则。
9 月 15 日生效的两条规则
第一条针对带广告的页面。对新接入 Cloudflare 的域名、现有客户新开的站点,广告页上默认拦截 Training 和 Agent,Search 保持放行。同一天,从没改过设置的免费账户也会被迁到这个默认配置。
第二条影响面更大。Cloudflare 决定按最严规则处理多用途爬虫,官方博客把话说得很直接,多用途爬虫「比如 Googlebot、Applebot 和 Bingbot,会被选择了拦截 Training 的客户拦掉」,无论这个选择来自新的分类选项,还是去年那版 Block AI bots 开关。也就是说,只要还开着任何一版「拦 AI」开关,9 月 15 日之后,Google 的抓取也会跟着被拦在门口。
想保留 Googlebot 的人,可以在 9 月 15 日之前到 Security 设置里打个标记,声明自己不想改变这些同时干搜索的训练爬虫的待遇。Cloudflare 说临近日期还会继续发通知。
Cloudflare 为什么把账算到 Google 头上
Cloudflare 做这件事的账,官方博客里有几组数字。按它自己的统计,现在它网络上超过一半的请求来自机器。训练类爬虫已经占爬虫请求的大头,2025 年春天这个比例还是两成出头,今年 6 月到了 52%。过去一年,每日 AI agent 请求涨了 1700% 以上。更让它恼火的是重复抓取,一半以上的 AI 抓取在抓没有变化过的页面。
去年 7 月 Cloudflare 还算过一笔更狠的账。每换回一个真人访客,Google 要抓 14 次,OpenAI 抓 1700 次,Anthropic 抓 73000 次。这笔账背后是它反复讲的一个判断。如果你开的是小站,麻烦有两件,有人拿你的内容训练模型,没人能找到你。于是站主被迫做一桩浮士德交易,进搜索让 AI 训练你,或者保住内容、丢掉被发现的机会。
Cloudflare 把矛头指向了把搜索和训练合在同一个爬虫里的大厂。它在博客里喊话,凡是同时建搜索索引、当 Agent、抓数据训练的公司,都该把自动化拆成三个独立的爬虫。Matthew Prince 在新闻稿里说得客气一点,希望这些新默认能促使混用爬虫把搜索从 agent 用途和训练里拆出来。新闻稿还算了笔账,最大的搜索引擎拿到手的网页信息,大约是头部 AI 公司的两倍,因为它让站主没法在保住被发现机会的同时拒绝被训练。
Google 的账算得不一样
Google 那边的安排确实是另一套。Googlebot 一个用户代理,同时负责搜索索引和为 AI 功能抓取。想拒绝训练的人,只能在 robots.txt 里给 Google-Extended 一个指令。按 Google 自己的爬虫文档,这个指令管的是内容能不能拿来训练新一代 Gemini 模型,不影响站点进不进 Google 搜索,也不是排名信号。而且 Google-Extended 没有独立的用户代理,抓取仍然由 Googlebot 完成,指令本身只是控制信号。
分歧就在这里。在 robots.txt 这一层,站主可以保留搜索、拒绝训练,因为抓取完成之后,两个偏好可以分开处理。Cloudflare 在请求这一层执行,一个爬虫到门口,要么放进来要么拦出去,拦不了半个 Googlebot。所以只要 Google 不把搜索和训练拆成两个爬虫,在 Cloudflare 上拦训练爬虫的代价,就是连 Googlebot 一起丢掉。到目前为止,Google 没有表现出要拆的意思。
回到开头那位站主。他 7 月初开始看到的 403,发生在官方生效日期之前两个月,Cloudflare 还没有给出确认的解释。7 月下旬另一位站主也报了类似的间歇性拦截。这些报告提醒一件事,规则的边界在实际部署里会抖,等到 9 月 15 日之后再看日志,可能已经晚了。
谁会真的中招
把受影响的面摊开看。
去年开过 Block AI bots 开关、之后没再碰过的人,是第一类。2025 年 7 月第一波「拦 AI」讨论最热的时候,很多站把这个开关当成无风险的防御动作打开,然后忘了。9 月 15 日之后,这个开关会按新逻辑把 Googlebot 一起拦掉。
第二类是 9 月 15 日之后新接入 Cloudflare 的域名,广告页默认拦 Training 和 Agent。
第三类是从来不改设置的免费账户,当天会被迁到新默认。
反过来,这些情况不受影响。没开任何 AI 拦截的现有付费 zone,什么都不会变。全站没有广告的站点,广告页那条默认够不着,但只要你开着拦 Training 的开关,多用途规则照样适用。站不在 Cloudflare 后面的人,整件事跟你没关系。
出海站现在该查的四件事
第一,先确认站到底在不在 Cloudflare 后面。不少 SEO 团队不知道这件事,因为当年是 IT 配的。查 DNS,或者直接问。
第二,打开 Security 设置里的 bot 流量项。看旧版 Block AI bots 开关当前是什么值,全部页面、仅广告页面还是关闭,再记下是谁开的。新的 Search、Agent、Training 三类预设也在这里。
第三,确认站上有没有任何页面带广告。赞助位、合作横幅、资源页的广告都算。这决定广告页默认规则会不会够到你。
第四,留基线。把 Search Console 的抓取统计导出一份,截图机器人设置,存一份当前 robots.txt。9 月 15 日之后抓取量突然往下掉、内容没变,这就是被误拦的信号。
三条路,代价各不同
对大多数出海站,问题可以简化成一次选择。
第一条路最省心,选 opt-out。9 月 15 日之前在 Security 设置里声明保留 Googlebot 这类同时干搜索的训练爬虫,单用途的训练爬虫继续拦。卖货的站基本都应该走这条,SEO 和 GEO 两边都不放。
第二条路是接受新规则,继续拦 Training,让 Googlebot 跟着一起被拦。这条路适合把内容当成谈判筹码、另有流量来源的出版方。多数商业站承受不起搜索结果里消失的代价。
第三条是折中,只对带广告的页面拦 Training,观察抓取变化。
对卖东西的站,拦 Search 类爬虫几乎没有说得过去的理由,AI 答案里的引用本身已经是一个发现渠道。真在意训练数据的人,可以把两层工具分开用。robots.txt 里的 Google-Extended 和 Cloudflare 7 月起测试的 Content Signals use= 字段负责表态,WAF 和 bot 管理负责执行。表态不影响收录,执行才会把人拦在门外。
9 月 15 日眼看就到了。Cloudflare 说会继续发通知,但这些邮件通常寄到四年前注册域名的人手里。窗口只剩三周,自己打开 dashboard 看一眼,比等一封不知道寄给谁的通知可靠。


