GPTBot 和 OAI-SearchBot 的区别:挡错那个代价最大

挡掉 GPTBot 不会让你从 ChatGPT 消失,管那件事的是 OAI-SearchBot。每家 AI 公司现在都跑好几个爬虫,这是逐个核过官方文档的地图。

抓取与收录3 分钟读完1066 次阅读
GPTBot 和 OAI-SearchBot 的区别:挡错那个代价最大

规则变动 · 2026-08-15 · 各运营方官方文档

GPTBot 和 OAI-SearchBot 的区别是这里面最要紧的一条,而且它可以推广:现在每一家主流 AI 公司都在跑好几个爬虫、各管各的活,所以挡错那一个是代价最大的错误。挡掉 GPTBot 并不会让你从 ChatGPT 里消失——管那件事的是 OAI-SearchBot。Meta 现在有五个。而 Google 那个跟 AI 相关的令牌根本不是爬虫。

怎么核的

2026 年 8 月 15 日逐个读各家自己公布的 bot 文档,记录 robots.txt 令牌名和它自己写的用途。不用第三方名单、不用别人的转述,就是那些页面本身。

GPTBot 和 OAI-SearchBot 的区别,以及其余的地图

按公司分组。加粗的用途,是决定你今天出不出现在答案里的那些。

公司令牌干什么的
OpenAIGPTBot抓内容用于训练基础模型
OAI-SearchBot驱动 ChatGPT 的搜索功能。退出的站不会出现在 ChatGPT 搜索答案里
ChatGPT-User用户发起的抓取,不是自动爬取
AnthropicClaudeBot收集可能用于训练的网页内容
Claude-SearchBot改善搜索结果质量
Claude-User支持用户发起的、需要联网的请求
PerplexityPerplexityBot让网站出现并被链接在 Perplexity 结果里。明确不用于训练基础模型
Perplexity-User用户触发的抓取,一般忽略 robots.txt
MetaMeta-WebIndexer改善 Meta AI 搜索结果质量
Meta-ExternalAgent训练基础模型,也做内容索引
Meta-ExternalFetcher按用户请求抓取单个链接
Meta-ExternalAds广告与商业产品
FacebookExternalHit抓取被分享到 Meta 各 App 上的内容
GoogleGoogle-Extended只管 Gemini 训练。不是爬虫,没有独立的 HTTP UA
AppleApplebot-Extended只管模型训练。不抓取网页

三种活,只有一种挡了会掉可见度

不按公司、改按「干什么活」分组,决定立刻就简单了。

令牌挡掉的代价
搜索与答案OAI-SearchBotClaude-SearchBotPerplexityBotMeta-WebIndexer你在那些答案里的位置。
模型训练GPTBotClaudeBotMeta-ExternalAgentGoogle-ExtendedApplebot-Extended今天看不出任何损失。
用户触发ChatGPT-UserClaude-UserPerplexity-UserMeta-ExternalFetcher靠 robots.txt 管不住。

它造成的那个具体误会

最常见的版本:有人读了几条关于 AI 抓取的新闻,加上 User-agent: GPTBotDisallow: /,以为自己从 ChatGPT 里退出了。他退出的是训练。ChatGPT 的搜索功能跑在 OAI-SearchBot 上,那个还开着、还在收录他——而对多数站来说,这正是他本来想要的结果。

反过来那个错误更糟:一条一刀切规则把每个令牌都网进去,为了防住一件本来也不太在意的训练,把自己从四个答案引擎里删掉了。

Meta 是最该回头看一眼的

Meta 现在记录了五个独立 agent,而喂 Meta AI 搜索结果的 Meta-WebIndexer 新到多数公开的 robots.txt 示例里都还没有它。你要是抄了一份几个月前的配置,它多半根本没提这个名字。

这也是问题的一般形状:这些名单一直在变,一份写完就不动的 robots.txt,只是某个下午的快照。

我们没有核实的部分

这些爬虫是不是真按文档行事。我们读的是各家公布的东西;没有测过一个被挡掉的令牌会不会真的停止请求,也没有任何一个挡了它们的站的服务器日志。上面每一条用途都是运营方的说法,不是我们的观察。

常见问题

你们是怎么核实的

2026 年 8 月 15 日逐个读各运营方自己的 bot 文档,令牌和用途直接取自那些页面。哪一条规则会被哪个爬虫遵守(那条分组匹配规则)在robots.txt 怎么写才管得住 AI 爬虫里。

挡掉训练类爬虫会伤到我吗

按运营方自己的描述,今天的答案里不会。那是一个关于未来模型的商业决定,不是一个可见度决定。

这份名单多久变一次

变得够频繁,以至于半年后我们不会相信任何一份它的副本——包括这一份。动手改之前先去看各家的页面。

一句话

一家公司、几个爬虫、各管各的活,而今天只有搜索那一类挡了要付代价。把这个区别落进你的 robots.txt、再推送收录,是个十分钟的活,而多数网站从来没有认真做过一次。

GPTBot 和 OAI-SearchBot 的区别:挡错那个代价最大