geo 优化的第一步:四个引擎各自公开了什么,没公开什么

geo 优化能做的第一件事不是写作技巧,是把管道接对。四个引擎没有一家公开过排序逻辑,但每家都公开了哪个爬虫喂哪个取材面——本篇给那张对照表和五步就绪检查。

排名与引用6 分钟读完2648 次阅读
geo 优化的第一步:四个引擎各自公开了什么,没公开什么

geo 优化能做的第一件事,不是写作技巧,是把管道接对。ChatGPT、Perplexity、Google 的 AI 答案面和 Copilot,没有任何一家公开过它们怎么给来源排序;但每一家都公开了另一半——哪个爬虫喂哪个取材面、哪个开关管哪件事。这半边一个下午就能查完,而多数页面进不了候选池,卡的正是这半边。

读这篇前

这一篇是一整簇的 hub,讲四个引擎共通的部分,细节交给别篇:哪些爬虫属于哪家公司在gptbot 和 oai-searchbot 的区别,管「你的页面能被摘多少」的那条指令在没有 noai,nosnippet 才是那个开关

在这些生效之前,你的页面得能被取到、而且交付的 HTML 里得真有文字。这一步没确认就先去确认——一个返回空壳的页面,下面写的对它一条都不成立。

公开了什么,没公开什么

这个区分值得用一行讲清楚,因为中文这个话题下的多数内容把两者混着说。爬虫名、User-Agent、IP 段、退出机制,每一家都有文档。选择与排序逻辑,没有任何一家有文档。

所以「ChatGPT 为什么选了 A 不选 B」这个问题没有诚实的答案。有确切答案的是另一个问题:你的页面要满足什么,才算进得了候选。这一篇讲的是后者。

哪个爬虫喂哪个取材面

这张表是本篇要你带走的第一样东西,每一行都出自厂商自己的文档,2026-08-17 逐条复核过。

取材面喂它的爬虫索引来自
ChatGPT 搜索结果OAI-SearchBotOpenAI 自己的索引
ChatGPT 就某一页作答ChatGPT-User用户触发,实时抓取
OpenAI 模型训练GPTBot与上面两个都分开
Perplexity 搜索结果PerplexityBotPerplexity 自己的索引
Perplexity 作答Perplexity-User用户触发,实时抓取
Google AI 答案与 AI 模式Googlebot常规 Google 索引
CopilotBingbotBing 索引

真正干活的是中间那一列。四个取材面,没有任何两个是同一个爬虫喂的——所以在一处放行,换到另一处什么都不算。

两条结论直接从表里掉出来。挡掉 GPTBot 并不会把你从 ChatGPT 的搜索结果里拿掉,因为那个面是另一个爬虫喂的——OpenAI 文档明写这些设置互相独立。以及,Google 的 AI 面和 Copilot 没有另外一个要单独放行的爬虫;你在底层索引里,你就已经在候选池里。

Perplexity 明说它的搜索爬虫不是训练爬虫

这句值得原文引,因为它拆掉了一个很常见的顾虑。Perplexity 的爬虫文档写着:PerplexityBot is designed to surface and link websites in search results on Perplexity. It is not used to crawl content for AI foundation models.(PerplexityBot 用于在 Perplexity 搜索结果里呈现并链接网站,不用于为 AI 基础模型抓取内容。)

也就是说,很多人以为自己在做的那笔交易——拿训练数据换曝光——在这里并不是摆在桌上的那笔。要不要相信一家厂商关于自己怎么用你内容的声明,是你自己的判断;但这句声明是白纸黑字、有日期的。

交付物:geo 优化的五步就绪检查

每个站跑一遍。每一步都能用 curl 或浏览器在站外自己验证——这是重点,全程不依赖任何厂商告诉你做得怎么样。

  1. 用 curl 取一次页面,确认作为答案的那段文字在交付的 HTML 里,不是后注入的。
  2. robots.txt 里 OAI-SearchBot 和 PerplexityBot 的规则,与 GPTBot 分开看。想出现在那两个搜索面上,就确认前两个是放行的。
  3. 确认 Googlebot 和 Bingbot 在任何一层都没被挡——包括 CDN,那是与 robots.txt 各自独立的一个决定。
  4. 查 meta robots 和 X-Robots-Tag 里有没有 nosnippet。它会让你在排得上的同时消失在 Google 的 AI 面上。
  5. 确认每一页在某个标题下的头 80 字里就把自己那句结论说完,让提取方有一段边界清楚的文字可摘。

前四步里任何一步不过,都是管道问题,修一次就好。第五步是长期功夫,也是唯一越投入回报越大的一步。

顺序比看上去重要。前四步里任何一步都能悄悄把后面几步作废,所以从上往下做,能省下在一个爬虫根本取不到的页面上打磨段落的时间。先在一个有代表性的页面上把五步跑完,再往全站推。

两个最常被搞混的控制项

这两个都独立于 robots.txt,也正是「看起来全开着却仍然进不了 AI 面」的原因。

控制项管什么不管什么
nosnippet / max-snippet能展示多少文字,含 Google 的 AI 功能不阻止抓取或收录
Google-Extended你的内容能否用于 Gemini 训练不会把你从搜索或 AI 答案里拿掉

Google-Extended 尤其容易被防御性地一开了之,然后把它造不成的流量变化算到它头上。它到底有什么代价、没有什么代价,算得最细的一笔账在google-extended 屏蔽的代价里。

做错了会怎样

三种错法都是配置问题长着内容问题的脸,所以它们能活很久——站主跑去重写一个本来就没毛病的页面。

  1. 挡了某家的训练爬虫,以为它的搜索面跟着一起挡了。文档明写两者独立,结果是一次看不见的半挡。
  2. robots.txt 改对了,CDN 还在拦同一批爬虫。文件说可以,边缘说不行,边缘赢。
  3. 先打磨文字再查管道。一个谁都取不到的页面,不会因为第一段写得更好而受益。

这一篇到哪儿为止

我们无法告诉你为什么一个页面被引用而另一个相似的没有。这些公司之外没有人说得了,任何给你一份带权重的排序因素清单的来源,描述的是一种信念,不是一份规范。重抓频率也一样没有公开。

这一篇做的是把问题框住。上面每一条都可验证,等它们全部成立之后,剩下的变量就只有内容本身。管道全对了还是没被引用,接下来该改的是页面,不是配置——那是另一篇的事。

什么时候该停手:五步全绿之后就别再回来调配置了。这一篇对「已经全绿却仍然不被引用」的情况不适用——那时候再改 robots.txt 或 meta 标签,改的是一个已经没有问题的地方。

说白了:geo 优化是两个问题穿着一件外套,只有前一个有文档可依。把这五项检查在整站范围内长期保持成立,而不是只在你随手测的那一页上,正是 QueryWin 要做的事。

常见问题

挡了 GPTBot,ChatGPT 就不会引用我了吗?

不会。OpenAI 文档把 GPTBot 和 OAI-SearchBot 记为互相独立的设置,而搜索面是后者喂的。挡掉训练爬虫,搜索那条路仍然通着。

要不要单独放行 ChatGPT-User 和 Perplexity-User?

这两个是用户触发的爬虫:有人在产品里专门问到了你这一页,它才来取。挡掉它们,等于那个专门来找你的访客拿到的是一句抱歉。这跟收录类爬虫是两个决定,而且通常更好做。

AI 答案面要放行哪个爬虫?

没有另外的。AI 答案取的是常规 Google 索引,所以相关的许可就是你早就给 Googlebot 的那个。真正影响它那儿表现的开关是 max-snippet

国内网络取不到这些官方文档怎么办?

本篇引的两份文档地址都写在存档里,用能直连的网络取一次、存成本地副本即可,几分钟的事。真正要避开的是拿中文转述当依据:爬虫名和各家表述一直在变,而转述通常不带日期,你没法判断它说的是哪一版。宁可存一份带日期的英文原文,也别信一篇不知道什么时候写的中文总结。

这些答案会变吗?

会,所以本篇的爬虫名都带着日期。各家按自己的节奏增删和改名;一份超过几个月的清单,动手前回官方文档重读一遍。

本文属于 QueryWin 实操手册 · 第 2 阶

geo 优化的第一步:四个引擎各自公开了什么,没公开什么