Google-Extended 屏蔽了,Google 搜索里一分钱代价都没有

Google-Extended 屏蔽之后只影响 Gemini 训练。Google 自己的文档写明它不影响搜索收录和排名——真正花钱的是那几行名字里带「搜索」的。

抓取与收录4 分钟读完2889 次阅读
Google-Extended 屏蔽了,Google 搜索里一分钱代价都没有

规则变动 · 2026-08-15 · Google 与 Apple 官方文档

把 Google-Extended 屏蔽掉,在 Google 搜索里一分钱代价都没有。Google 自己的爬虫文档写得清清楚楚,Apple 对它那个对应的令牌也是同样的说法。这两行管的都只是模型训练。真正决定你会不会出现在 AI 答案里的是另外几行,挡错了才是贵的。

Google-Extended 屏蔽之后到底发生什么

两句原文基本就把这事定了。Google 讲 Google-Extended:"does not impact a site's inclusion in Google Search nor is it used as a ranking signal in Google Search."(不影响网站在 Google 搜索里的收录,也不作为排名信号。)Apple 讲 Applebot-Extended:"does not crawl webpages",而且"webpages that disallow Applebot-Extended can still be included in search results."(禁止它的页面照样能进搜索结果。)

两页都是 2026 年 8 月 15 日读的:Google 的爬虫总表Apple 的 Applebot 说明。这两句话都不是新写的,只是传得远不如那份恐慌。

这两个根本不是爬虫

这是最容易绊住人的地方。Google-Extended 和 Applebot-Extended 从来不向你的服务器发请求。Google 的文档写着 Google-Extended "doesn't have a separate HTTP request user agent string"(没有独立的 HTTP 请求 UA 串)。它们是标签,告诉一家公司:别的爬虫已经抓走的内容,你可以怎么用。

所以没有流量可看,没有状态码可读,你这边也没有任何办法确认对方真的照办了。这一点得说在明处——这个领域里别的检查都会留下证据,这一个不留。

文档没说的那部分

把边界划清楚很重要,因为写得笃定的文章通常就是在这儿超出了它的出处。Google 给这个令牌划了两条线:它管的是抓走的内容能不能拿去训练以后的 Gemini,以及它不影响搜索收录和排名。文档的射程就这么大。

文档没做的事,是把 Google 名下每一个 AI 界面逐个点名、说清楚哪个受影响哪个不受。所以如果你真正想问的是"屏蔽了会不会少出现在 AI 概览里",老实的回答是:文档没回答这个问题,我们自己也没有测过。有据可查的只是——AI 概览建立在 Google 搜索之上,而喂搜索的是 Googlebot,那是你文件里的另一行,这个设置碰不到它。

哪一行花的是什么钱

"退出 AI"不是一个决定,是两个,而且方向相反。训练类的令牌,挡了今天看不出任何损失;搜索类的令牌,挡了就等于不让 AI 引用你。

robots.txt 里的名字发不发请求挡掉的代价
Google-Extended不发只影响 Gemini 训练。Google 搜索里没有代价。
Applebot-Extended不发只影响 Apple 模型训练。照样进搜索结果。
GPTBotOpenAI 模型训练。不是 ChatGPT 搜索。
ClaudeBotAnthropic 模型训练。
OAI-SearchBot你在 ChatGPT 取材池里的位置。
PerplexityBot你在 Perplexity 结果里的位置。
Claude-SearchBot你在 Claude 搜索结果里的位置。
GooglebotGoogle 本身,连 AI 概览一起。

真正会出事的是下面四行。一个只想退出 AI 训练、顺手写了条一刀切规则的人,能一次性把自己从所有 AI 答案里删掉——而他本来想做的事窄得多。

它造成的那个错误

通常就是一行看起来很利落的规则,出自一个读过几条 AI 抓取的新闻、想一次了结的人:

User-agent: *
Disallow: /

这不是退出 AI 训练,这是退出整个互联网。而且因为爬虫只遵守指名自己最具体的那一组,你在文件别处再加指名分组也软化不了它——两组不合并。这个坑我们单独写过一篇:robots.txt 怎么写才管得住 AI 爬虫

今天该怎么做

把两个问题分开决定,按这个顺序,因为只有第二个的后果是能反悔的。

  1. 你想不想被 AI 引用?想的话,OAI-SearchBotPerplexityBotClaude-SearchBotGooglebotbingbot 一个都别动。这个决定动的是流量。
  2. 你愿不愿意被拿去训练模型?不愿意,就禁掉 GPTBotClaudeBotGoogle-ExtendedApplebot-ExtendedCCBot。第一组一点都不受影响。

然后回头确认第一组真的还进得来——robots.txt 改成什么样,都不能告诉你 CDN 同不同意。

常见问题

你们是怎么核实的

2026 年 8 月 15 日读各家自己的文档,直接引原文,不引任何人对它的转述,两页都在上面给了链接。我们没有在真实网站上测这两个令牌,因为它们测不了——见第二节。

屏蔽之后,之前被拿去训练的内容会删掉吗

不会。这些指令都是往后生效的,管的是以后能不能用,不管这行字出现之前已经收走的东西。

屏蔽 Google-Extended 会不会掉出 AI 概览

我们没有第一方数据,不装作有。有文档依据的只有更窄的一句:Google 说这个令牌管的是 Gemini 模型训练,不影响搜索收录和排名。AI 概览建立在 Google 搜索之上,而喂搜索的爬虫是 Googlebot。

有办法确认这行设置生效了吗

没有。这是老实话。它不发请求,所以你的日志里两种情况都是一样的:什么都没有。

一句话

robots.txt 里听起来最吓人的两行,其实最不花钱。真正花钱的那几行没人提醒你,因为它们的名字里带的是"搜索",不是"AI"。把改动写完、发出去、再推送收录,才决定这些事最后有没有显出来。

Google-Extended 屏蔽了,Google 搜索里一分钱代价都没有