geo 优化的第一步:四个引擎各自公开了什么,没公开什么
geo 优化能做的第一件事不是写作技巧,是把管道接对。四个引擎没有一家公开过排序逻辑,但每家都公开了哪个爬虫喂哪个取材面——本篇给那张对照表和五步就绪检查。

geo 优化能做的第一件事,不是写作技巧,是把管道接对。ChatGPT、Perplexity、Google 的 AI 答案面和 Copilot,没有任何一家公开过它们怎么给来源排序;但每一家都公开了另一半——哪个爬虫喂哪个取材面、哪个开关管哪件事。这半边一个下午就能查完,而多数页面进不了候选池,卡的正是这半边。
读这篇前
这一篇是一整簇的 hub,讲四个引擎共通的部分,细节交给别篇:哪些爬虫属于哪家公司在gptbot 和 oai-searchbot 的区别,管「你的页面能被摘多少」的那条指令在没有 noai,nosnippet 才是那个开关。
在这些生效之前,你的页面得能被取到、而且交付的 HTML 里得真有文字。这一步没确认就先去确认——一个返回空壳的页面,下面写的对它一条都不成立。
公开了什么,没公开什么
这个区分值得用一行讲清楚,因为中文这个话题下的多数内容把两者混着说。爬虫名、User-Agent、IP 段、退出机制,每一家都有文档。选择与排序逻辑,没有任何一家有文档。
所以「ChatGPT 为什么选了 A 不选 B」这个问题没有诚实的答案。有确切答案的是另一个问题:你的页面要满足什么,才算进得了候选。这一篇讲的是后者。
哪个爬虫喂哪个取材面
这张表是本篇要你带走的第一样东西,每一行都出自厂商自己的文档,2026-08-17 逐条复核过。
| 取材面 | 喂它的爬虫 | 索引来自 |
|---|---|---|
| ChatGPT 搜索结果 | OAI-SearchBot | OpenAI 自己的索引 |
| ChatGPT 就某一页作答 | ChatGPT-User | 用户触发,实时抓取 |
| OpenAI 模型训练 | GPTBot | 与上面两个都分开 |
| Perplexity 搜索结果 | PerplexityBot | Perplexity 自己的索引 |
| Perplexity 作答 | Perplexity-User | 用户触发,实时抓取 |
| Google AI 答案与 AI 模式 | Googlebot | 常规 Google 索引 |
| Copilot | Bingbot | Bing 索引 |
真正干活的是中间那一列。四个取材面,没有任何两个是同一个爬虫喂的——所以在一处放行,换到另一处什么都不算。
两条结论直接从表里掉出来。挡掉 GPTBot 并不会把你从 ChatGPT 的搜索结果里拿掉,因为那个面是另一个爬虫喂的——OpenAI 文档明写这些设置互相独立。以及,Google 的 AI 面和 Copilot 没有另外一个要单独放行的爬虫;你在底层索引里,你就已经在候选池里。
Perplexity 明说它的搜索爬虫不是训练爬虫
这句值得原文引,因为它拆掉了一个很常见的顾虑。Perplexity 的爬虫文档写着:PerplexityBot is designed to surface and link websites in search results on Perplexity. It is not used to crawl content for AI foundation models.(PerplexityBot 用于在 Perplexity 搜索结果里呈现并链接网站,不用于为 AI 基础模型抓取内容。)
也就是说,很多人以为自己在做的那笔交易——拿训练数据换曝光——在这里并不是摆在桌上的那笔。要不要相信一家厂商关于自己怎么用你内容的声明,是你自己的判断;但这句声明是白纸黑字、有日期的。
交付物:geo 优化的五步就绪检查
每个站跑一遍。每一步都能用 curl 或浏览器在站外自己验证——这是重点,全程不依赖任何厂商告诉你做得怎么样。
- 用 curl 取一次页面,确认作为答案的那段文字在交付的 HTML 里,不是后注入的。
- 查
robots.txt里 OAI-SearchBot 和 PerplexityBot 的规则,与 GPTBot 分开看。想出现在那两个搜索面上,就确认前两个是放行的。 - 确认 Googlebot 和 Bingbot 在任何一层都没被挡——包括 CDN,那是与 robots.txt 各自独立的一个决定。
- 查 meta robots 和
X-Robots-Tag里有没有nosnippet。它会让你在排得上的同时消失在 Google 的 AI 面上。 - 确认每一页在某个标题下的头 80 字里就把自己那句结论说完,让提取方有一段边界清楚的文字可摘。
前四步里任何一步不过,都是管道问题,修一次就好。第五步是长期功夫,也是唯一越投入回报越大的一步。
顺序比看上去重要。前四步里任何一步都能悄悄把后面几步作废,所以从上往下做,能省下在一个爬虫根本取不到的页面上打磨段落的时间。先在一个有代表性的页面上把五步跑完,再往全站推。
两个最常被搞混的控制项
这两个都独立于 robots.txt,也正是「看起来全开着却仍然进不了 AI 面」的原因。
| 控制项 | 管什么 | 不管什么 |
|---|---|---|
nosnippet / max-snippet | 能展示多少文字,含 Google 的 AI 功能 | 不阻止抓取或收录 |
| Google-Extended | 你的内容能否用于 Gemini 训练 | 不会把你从搜索或 AI 答案里拿掉 |
Google-Extended 尤其容易被防御性地一开了之,然后把它造不成的流量变化算到它头上。它到底有什么代价、没有什么代价,算得最细的一笔账在google-extended 屏蔽的代价里。
做错了会怎样
三种错法都是配置问题长着内容问题的脸,所以它们能活很久——站主跑去重写一个本来就没毛病的页面。
- 挡了某家的训练爬虫,以为它的搜索面跟着一起挡了。文档明写两者独立,结果是一次看不见的半挡。
- robots.txt 改对了,CDN 还在拦同一批爬虫。文件说可以,边缘说不行,边缘赢。
- 先打磨文字再查管道。一个谁都取不到的页面,不会因为第一段写得更好而受益。
这一篇到哪儿为止
我们无法告诉你为什么一个页面被引用而另一个相似的没有。这些公司之外没有人说得了,任何给你一份带权重的排序因素清单的来源,描述的是一种信念,不是一份规范。重抓频率也一样没有公开。
这一篇做的是把问题框住。上面每一条都可验证,等它们全部成立之后,剩下的变量就只有内容本身。管道全对了还是没被引用,接下来该改的是页面,不是配置——那是另一篇的事。
什么时候该停手:五步全绿之后就别再回来调配置了。这一篇对「已经全绿却仍然不被引用」的情况不适用——那时候再改 robots.txt 或 meta 标签,改的是一个已经没有问题的地方。
说白了:geo 优化是两个问题穿着一件外套,只有前一个有文档可依。把这五项检查在整站范围内长期保持成立,而不是只在你随手测的那一页上,正是 QueryWin 要做的事。
常见问题
挡了 GPTBot,ChatGPT 就不会引用我了吗?
不会。OpenAI 文档把 GPTBot 和 OAI-SearchBot 记为互相独立的设置,而搜索面是后者喂的。挡掉训练爬虫,搜索那条路仍然通着。
要不要单独放行 ChatGPT-User 和 Perplexity-User?
这两个是用户触发的爬虫:有人在产品里专门问到了你这一页,它才来取。挡掉它们,等于那个专门来找你的访客拿到的是一句抱歉。这跟收录类爬虫是两个决定,而且通常更好做。
AI 答案面要放行哪个爬虫?
没有另外的。AI 答案取的是常规 Google 索引,所以相关的许可就是你早就给 Googlebot 的那个。真正影响它那儿表现的开关是 max-snippet。
国内网络取不到这些官方文档怎么办?
本篇引的两份文档地址都写在存档里,用能直连的网络取一次、存成本地副本即可,几分钟的事。真正要避开的是拿中文转述当依据:爬虫名和各家表述一直在变,而转述通常不带日期,你没法判断它说的是哪一版。宁可存一份带日期的英文原文,也别信一篇不知道什么时候写的中文总结。
这些答案会变吗?
会,所以本篇的爬虫名都带着日期。各家按自己的节奏增删和改名;一份超过几个月的清单,动手前回官方文档重读一遍。
本文属于 QueryWin 实操手册 · 第 2 阶


