block ai training bots:挡掉训练,别把搜索一起挡了

block ai training bots 之前你很可能选的是 Block —— 2026 年 9 月 15 日起那个开关会连 Googlebot、Bingbot、Applebot 一起挡掉。这篇讲清四家运营方各自的机制、该写哪一行、以及我们在自己六个站上查到了什么。

抓取与收录7 分钟读完2828 次阅读
block ai training bots:挡掉训练,别把搜索一起挡了

规则变动 · 2026-09-15 · Cloudflare

Cloudflare 在 2026 年 9 月 15 日改了 Block 这个开关的含义。你原本用它来 block ai training bots,现在它会连 Googlebot、Bingbot、Applebot 一起挡掉,搜索也一起没了。替代它的是一个叫 Disallow AI Training 的设置,它只做一件事:往你的 robots.txt 里写一条「不许拿去训练」的偏好。搜索照常。

9 月 15 日到底改了什么

Cloudflare 这次发布了一个新设置加一个叫 Accountable 的新称谓。新设置 Disallow AI Training 会往你的 robots.txt 写一条 no-training 偏好。Accountable 是发给爬虫运营方的标签,要满足四条:提供 robots.txt 层面的训练退出机制;提供 AI 摘要的退出机制;给出 URL 级的可见性,让你知道哪些页面被拿去做训练;以及承诺退出训练不影响传统搜索结果。Apple、Google、Microsoft 三家被列为符合。

真正会咬人的是语义改动。公告原文写的是 Block 和 Block on pages with ads 现在「apply to mixed-use crawlers, including Applebot, Bingbot, and Googlebot, so either setting impacts search as well as training」。在这之前,这两个设置恰恰是为了不影响搜索才特意跳过混合用途爬虫的。如果你的站点从 2024 年起就一直选着 Block,你以为它说的是「不要 AI」,它现在说的是「连搜索也不要」。公告自己的说法很直接:「If you want mixed-use crawlers gone entirely, you now have to say so. Select Block.」

同一次发布里还有三件事。原来那个一刀切的开关被弃用,换成 Search / Training / Agent 三个分开的控制项。Managed Robots.txt 被弃用,换成 Bot Preference Sync。Disallow AI Training 进入新域名的推荐配置,而且按「这个站靠不靠广告赚钱」分成两套预设,靠广告变现的站更严。

出处:Cloudflare《Have it both ways: stay discoverable in search while disallowing AI training》,2026 年 9 月 15 日发布,2026 年 9 月 21 日访问,blog.cloudflare.com/accountable-mixed-use-ai-crawlers

这件事卡在哪个概念上

混合用途爬虫(mixed-use crawler)指的是同一个 user agent 干两件事:一边建搜索索引,一边收集训练数据。Googlebot、Bingbot、Applebot 都是。这就是为什么过去挡它们是一个打包价 —— 你没法只要一半。也正因为如此,Cloudflare 在没有得到运营方点头之前,给不了这三家一个「只挡训练」的开关。

对你来说,真正要分清的是爬虫控制令牌。爬虫会向你的服务器发请求。控制令牌不发 —— 它只是 robots.txt 里的一个名字,用来告诉某家公司「你别的爬虫已经抓走的那份内容,可以怎么用」。Google 自己的爬虫文档说得很直白:Google-Extended「doesn't have a separate HTTP request user agent string. Crawling is done with existing Google user agent strings; the robots.txt user-agent token is used in a control capacity.」

这句话有个很实际的后果:你 disallow 一个控制令牌,日志里什么都不会出现,所以你在自己这边无法确认这条偏好有没有被遵守。你只能选择相信运营方的承诺。这个领域里其他每一件事都能留下证据,只有这一件留不下。

四家运营方各自给了什么

跟你关系最大的是四家。每一家都公布了自己的机制,而且都不需要第三方参与。下面这张表来自各家自己的文档,不是别人对它的转述。

运营方机制管什么影响搜索
Googlerobots.txt 里的 Google-ExtendedGemini 训练与 grounding不影响 —— Google 说它不是排名信号
Applerobots.txt 里的 Applebot-ExtendedApple 的基础模型不影响 —— 被 disallow 的页面照样留在搜索结果里
Microsoft今天的做法是 NOARCHIVE meta 标签Microsoft 的生成式模型不影响 —— Bing 说带标签的页面照常出现在结果里
Amazon / Anthropic / Meta / OpenAI直接挡它们的训练爬虫只训练,不含搜索不影响 —— 它们的搜索爬虫是另一个 user agent

Google 那句话值得记住:Google-Extended「does not impact a site's inclusion in Google Search nor is it used as a ranking signal in Google Search.」Apple 的意思一样,只是换个说法:Applebot-Extended「does not crawl webpages」,而且「webpages that disallow Applebot-Extended can still be included in search results.」Microsoft 在 2023 年就承诺过同一件事:带 NOARCHIVE 标签的内容「will not be used for training Microsoft's generative AI foundation models」,同时带 NOCACHE 或 NOARCHIVE 标签的内容「will still appear in our search results」。

有一个缺口要单独点出来。Cloudflare 的公告说,Microsoft 还在做「在域名层面遵守 robots.txt 里 no-training 偏好」的机制,目标是 2027 年初。在那之前,你在 Cloudflare 里选 Disallow AI Training,并不会自动把这条偏好传给 Bing。今天真正生效的是 NOARCHIVE 这个 meta 标签。

block ai training bots 该怎么做,又不把搜索挡掉

把它当成两个决定,不是一个,而且按这个顺序做。第二个才是做错会掉流量的那个。

  1. 先决定你要不要被 AI 助手引用。要的话,搜索侧的爬虫一个都别动:OAI-SearchBotPerplexityBotClaude-SearchBotGooglebotbingbot。完成标志是这五个名字没有出现在任何一条针对公开路径的 Disallow 里。
  2. 再决定你要不要被拿去训练。不要的话,加的是控制令牌,不是爬虫:Google-ExtendedApplebot-Extended;训练和搜索本来就分开跑的几家,才直接挡爬虫 —— GPTBotClaudeBotCCBotmeta-externalagent。完成标志是每个令牌都有自己的分组,组里是 Disallow: /
  3. 检查两组会不会撞。爬虫只认那个点名它的最具体分组,规则不会相加。你如果本来就有一个点名 Googlebot 的分组,再加一个不会跟它合并。完成标志是你关心的每个 user agent 在文件里只出现一次。
  4. 用爬虫的读法再读一遍。从文件开头往下找,遇到第一个 user agent 匹配的分组就停下,不再往下看。那个分组里的内容就是你对这个爬虫的全部政策。

第四步是大多数人跳过的,也正是它才能抓出下一段那个错。

我们先把自家的六个站查了一遍

在写这篇之前,我们先把自己的站抓了一遍。六个站全都点名了 Google-Extended 和 Applebot-Extended。但六个站没有一个在公开路径上 disallow 它们 —— 也就是说,六个站都没有表达任何训练退出偏好。令牌是写上了,然后跟其他所有东西一起被 allow 掉了。

站点Google-ExtendedApplebot-Extended
byerisk.com写了,放行写了,放行
sizemarker.com写了,放行写了,放行
biaojixia.com写了,放行写了,放行
cuotiguanjia.com写了,放行写了,放行
hailuoshe.com写了,放行写了,放行
querywin.com写了,放行写了,放行

样本与口径:我们自己运营的六个站,2026 年 9 月 21 日各发一次 GET /robots.txt,桌面浏览器 UA、跟随跳转、不渲染。按文本读文件,找令牌名和它所在分组里的指令。六比六不是抽样统计,是我们自己站点上的一次自检 —— 而且它对一个正在写这个题目的站来说是最不体面的结果,所以更该放进来。

还有一个原因。Cloudflare 公告自己给了两个数:不到 1% 的站点选择屏蔽搜索爬虫,17% 的站点启用了某种屏蔽训练的机制。我们这六个站属于那 17% 里没启用的。如果你是带着「我的 robots.txt 早就说过训练的事了吧」这个假设读到这里的,那老实说:大多数文件什么都没说。

常见问题

这次变动你们是怎么核的

读 Cloudflare 自己的公告(2026 年 9 月 15 日发布),引的是改变行为的那些句子,不是描述意图的那些。表格里每一家运营方的说法,都回到它自己的文档或自己的博客里核过,正文里逐条给了链接。我们没在 Cloudflare 账号里实测过这些设置,所以你的套餐里后台长什么样,我们答不了。

Disallow AI Training 会影响我的 Google 排名吗

不会,Google 自己的爬虫文档就这么写的:Google-Extended「does not impact a site's inclusion in Google Search nor is it used as a ranking signal」。Cloudflare 在 Disallow AI Training 下发布的是「不训练」偏好,不是「不搜索」偏好。真会影响搜索的是 Block。

我现在选着 Block,是不是正在挡 Googlebot

有可能,别猜,去后台看。公告说 Block 现在适用于包括 Googlebot、Bingbot、Applebot 在内的混合用途爬虫。它的迁移表把老的 Block 设置落成 Search: Allow、Training: Disallow AI Training、Agent: Block on pages with ads —— 也就是被自动迁移的站保住了搜索。而在改动之后主动再选一次 Block 的站,是明确要求连搜索一起停。

Disallow AI Training 和直接挡训练爬虫有什么区别

主要是覆盖面。直接挡 GPTBotClaudeBot 你自己在 robots.txt 里就能做,不需要任何服务商参与,因为这几家本来就把训练放在单独的 user agent 上。Disallow AI Training 存在,是为了剩下那三家 —— Apple、Google、Microsoft —— 它们的搜索和训练是同一个 user agent。你要 block ai training bots 又不碰搜索,在 Apple / Google / Microsoft 这三家身上没法靠自己文件里的规则分开,只能靠控制令牌或 meta 标签。

这些偏好到底会不会被遵守,你们测了吗

没测,也测不了。这是老实话,而且它对这一行的每一种训练退出机制都成立,包括 Cloudflare 能在边缘强制的那些,也包括你自己写的那几行。你能验的只有可测的那一半:搜索侧爬虫是不是还进得来。那件事会在日志里留下记录。

一句话版本

Block 已经不是一周前的那个意思,你现在要的是 Disallow AI Training。想 block ai training bots 又不想花钱的,写 Google-ExtendedApplebot-Extended;真正会让你掉流量的那几行,名字里都带搜索。这条论证的长版本写在 Google-Extended 屏蔽了要付什么代价里,爬虫与控制令牌的区别写在 点名一个爬虫通常就等于挡掉它里。把它变成一个真能被搜索引擎接住的动作,是 QueryWin 在做的事

block ai training bots:挡掉训练,别把搜索一起挡了