block ai training bots:挡掉训练,别把搜索一起挡了
block ai training bots 之前你很可能选的是 Block —— 2026 年 9 月 15 日起那个开关会连 Googlebot、Bingbot、Applebot 一起挡掉。这篇讲清四家运营方各自的机制、该写哪一行、以及我们在自己六个站上查到了什么。

规则变动 · 2026-09-15 · Cloudflare
Cloudflare 在 2026 年 9 月 15 日改了 Block 这个开关的含义。你原本用它来 block ai training bots,现在它会连 Googlebot、Bingbot、Applebot 一起挡掉,搜索也一起没了。替代它的是一个叫 Disallow AI Training 的设置,它只做一件事:往你的 robots.txt 里写一条「不许拿去训练」的偏好。搜索照常。
9 月 15 日到底改了什么
Cloudflare 这次发布了一个新设置加一个叫 Accountable 的新称谓。新设置 Disallow AI Training 会往你的 robots.txt 写一条 no-training 偏好。Accountable 是发给爬虫运营方的标签,要满足四条:提供 robots.txt 层面的训练退出机制;提供 AI 摘要的退出机制;给出 URL 级的可见性,让你知道哪些页面被拿去做训练;以及承诺退出训练不影响传统搜索结果。Apple、Google、Microsoft 三家被列为符合。
真正会咬人的是语义改动。公告原文写的是 Block 和 Block on pages with ads 现在「apply to mixed-use crawlers, including Applebot, Bingbot, and Googlebot, so either setting impacts search as well as training」。在这之前,这两个设置恰恰是为了不影响搜索才特意跳过混合用途爬虫的。如果你的站点从 2024 年起就一直选着 Block,你以为它说的是「不要 AI」,它现在说的是「连搜索也不要」。公告自己的说法很直接:「If you want mixed-use crawlers gone entirely, you now have to say so. Select Block.」
同一次发布里还有三件事。原来那个一刀切的开关被弃用,换成 Search / Training / Agent 三个分开的控制项。Managed Robots.txt 被弃用,换成 Bot Preference Sync。Disallow AI Training 进入新域名的推荐配置,而且按「这个站靠不靠广告赚钱」分成两套预设,靠广告变现的站更严。
出处:Cloudflare《Have it both ways: stay discoverable in search while disallowing AI training》,2026 年 9 月 15 日发布,2026 年 9 月 21 日访问,blog.cloudflare.com/accountable-mixed-use-ai-crawlers。
这件事卡在哪个概念上
混合用途爬虫(mixed-use crawler)指的是同一个 user agent 干两件事:一边建搜索索引,一边收集训练数据。Googlebot、Bingbot、Applebot 都是。这就是为什么过去挡它们是一个打包价 —— 你没法只要一半。也正因为如此,Cloudflare 在没有得到运营方点头之前,给不了这三家一个「只挡训练」的开关。
对你来说,真正要分清的是爬虫和控制令牌。爬虫会向你的服务器发请求。控制令牌不发 —— 它只是 robots.txt 里的一个名字,用来告诉某家公司「你别的爬虫已经抓走的那份内容,可以怎么用」。Google 自己的爬虫文档说得很直白:Google-Extended「doesn't have a separate HTTP request user agent string. Crawling is done with existing Google user agent strings; the robots.txt user-agent token is used in a control capacity.」
这句话有个很实际的后果:你 disallow 一个控制令牌,日志里什么都不会出现,所以你在自己这边无法确认这条偏好有没有被遵守。你只能选择相信运营方的承诺。这个领域里其他每一件事都能留下证据,只有这一件留不下。
四家运营方各自给了什么
跟你关系最大的是四家。每一家都公布了自己的机制,而且都不需要第三方参与。下面这张表来自各家自己的文档,不是别人对它的转述。
| 运营方 | 机制 | 管什么 | 影响搜索 |
|---|---|---|---|
robots.txt 里的 Google-Extended | Gemini 训练与 grounding | 不影响 —— Google 说它不是排名信号 | |
| Apple | robots.txt 里的 Applebot-Extended | Apple 的基础模型 | 不影响 —— 被 disallow 的页面照样留在搜索结果里 |
| Microsoft | 今天的做法是 NOARCHIVE meta 标签 | Microsoft 的生成式模型 | 不影响 —— Bing 说带标签的页面照常出现在结果里 |
| Amazon / Anthropic / Meta / OpenAI | 直接挡它们的训练爬虫 | 只训练,不含搜索 | 不影响 —— 它们的搜索爬虫是另一个 user agent |
Google 那句话值得记住:Google-Extended「does not impact a site's inclusion in Google Search nor is it used as a ranking signal in Google Search.」Apple 的意思一样,只是换个说法:Applebot-Extended「does not crawl webpages」,而且「webpages that disallow Applebot-Extended can still be included in search results.」Microsoft 在 2023 年就承诺过同一件事:带 NOARCHIVE 标签的内容「will not be used for training Microsoft's generative AI foundation models」,同时带 NOCACHE 或 NOARCHIVE 标签的内容「will still appear in our search results」。
有一个缺口要单独点出来。Cloudflare 的公告说,Microsoft 还在做「在域名层面遵守 robots.txt 里 no-training 偏好」的机制,目标是 2027 年初。在那之前,你在 Cloudflare 里选 Disallow AI Training,并不会自动把这条偏好传给 Bing。今天真正生效的是 NOARCHIVE 这个 meta 标签。
block ai training bots 该怎么做,又不把搜索挡掉
把它当成两个决定,不是一个,而且按这个顺序做。第二个才是做错会掉流量的那个。
- 先决定你要不要被 AI 助手引用。要的话,搜索侧的爬虫一个都别动:
OAI-SearchBot、PerplexityBot、Claude-SearchBot、Googlebot、bingbot。完成标志是这五个名字没有出现在任何一条针对公开路径的Disallow里。 - 再决定你要不要被拿去训练。不要的话,加的是控制令牌,不是爬虫:
Google-Extended与Applebot-Extended;训练和搜索本来就分开跑的几家,才直接挡爬虫 ——GPTBot、ClaudeBot、CCBot、meta-externalagent。完成标志是每个令牌都有自己的分组,组里是Disallow: /。 - 检查两组会不会撞。爬虫只认那个点名它的最具体分组,规则不会相加。你如果本来就有一个点名
Googlebot的分组,再加一个不会跟它合并。完成标志是你关心的每个 user agent 在文件里只出现一次。 - 用爬虫的读法再读一遍。从文件开头往下找,遇到第一个 user agent 匹配的分组就停下,不再往下看。那个分组里的内容就是你对这个爬虫的全部政策。
第四步是大多数人跳过的,也正是它才能抓出下一段那个错。
我们先把自家的六个站查了一遍
在写这篇之前,我们先把自己的站抓了一遍。六个站全都点名了 Google-Extended 和 Applebot-Extended。但六个站没有一个在公开路径上 disallow 它们 —— 也就是说,六个站都没有表达任何训练退出偏好。令牌是写上了,然后跟其他所有东西一起被 allow 掉了。
| 站点 | Google-Extended | Applebot-Extended |
|---|---|---|
| byerisk.com | 写了,放行 | 写了,放行 |
| sizemarker.com | 写了,放行 | 写了,放行 |
| biaojixia.com | 写了,放行 | 写了,放行 |
| cuotiguanjia.com | 写了,放行 | 写了,放行 |
| hailuoshe.com | 写了,放行 | 写了,放行 |
| querywin.com | 写了,放行 | 写了,放行 |
样本与口径:我们自己运营的六个站,2026 年 9 月 21 日各发一次 GET /robots.txt,桌面浏览器 UA、跟随跳转、不渲染。按文本读文件,找令牌名和它所在分组里的指令。六比六不是抽样统计,是我们自己站点上的一次自检 —— 而且它对一个正在写这个题目的站来说是最不体面的结果,所以更该放进来。
还有一个原因。Cloudflare 公告自己给了两个数:不到 1% 的站点选择屏蔽搜索爬虫,17% 的站点启用了某种屏蔽训练的机制。我们这六个站属于那 17% 里没启用的。如果你是带着「我的 robots.txt 早就说过训练的事了吧」这个假设读到这里的,那老实说:大多数文件什么都没说。
常见问题
这次变动你们是怎么核的
读 Cloudflare 自己的公告(2026 年 9 月 15 日发布),引的是改变行为的那些句子,不是描述意图的那些。表格里每一家运营方的说法,都回到它自己的文档或自己的博客里核过,正文里逐条给了链接。我们没在 Cloudflare 账号里实测过这些设置,所以你的套餐里后台长什么样,我们答不了。
Disallow AI Training 会影响我的 Google 排名吗
不会,Google 自己的爬虫文档就这么写的:Google-Extended「does not impact a site's inclusion in Google Search nor is it used as a ranking signal」。Cloudflare 在 Disallow AI Training 下发布的是「不训练」偏好,不是「不搜索」偏好。真会影响搜索的是 Block。
我现在选着 Block,是不是正在挡 Googlebot
有可能,别猜,去后台看。公告说 Block 现在适用于包括 Googlebot、Bingbot、Applebot 在内的混合用途爬虫。它的迁移表把老的 Block 设置落成 Search: Allow、Training: Disallow AI Training、Agent: Block on pages with ads —— 也就是被自动迁移的站保住了搜索。而在改动之后主动再选一次 Block 的站,是明确要求连搜索一起停。
Disallow AI Training 和直接挡训练爬虫有什么区别
主要是覆盖面。直接挡 GPTBot 或 ClaudeBot 你自己在 robots.txt 里就能做,不需要任何服务商参与,因为这几家本来就把训练放在单独的 user agent 上。Disallow AI Training 存在,是为了剩下那三家 —— Apple、Google、Microsoft —— 它们的搜索和训练是同一个 user agent。你要 block ai training bots 又不碰搜索,在 Apple / Google / Microsoft 这三家身上没法靠自己文件里的规则分开,只能靠控制令牌或 meta 标签。
这些偏好到底会不会被遵守,你们测了吗
没测,也测不了。这是老实话,而且它对这一行的每一种训练退出机制都成立,包括 Cloudflare 能在边缘强制的那些,也包括你自己写的那几行。你能验的只有可测的那一半:搜索侧爬虫是不是还进得来。那件事会在日志里留下记录。
一句话版本
Block 已经不是一周前的那个意思,你现在要的是 Disallow AI Training。想 block ai training bots 又不想花钱的,写 Google-Extended 和 Applebot-Extended;真正会让你掉流量的那几行,名字里都带搜索。这条论证的长版本写在 Google-Extended 屏蔽了要付什么代价里,爬虫与控制令牌的区别写在 点名一个爬虫通常就等于挡掉它里。把它变成一个真能被搜索引擎接住的动作,是 QueryWin 在做的事。


