GPTBot 和 OAI-SearchBot 的区别:挡错那个代价最大
挡掉 GPTBot 不会让你从 ChatGPT 消失,管那件事的是 OAI-SearchBot。每家 AI 公司现在都跑好几个爬虫,这是逐个核过官方文档的地图。

规则变动 · 2026-08-15 · 各运营方官方文档
GPTBot 和 OAI-SearchBot 的区别是这里面最要紧的一条,而且它可以推广:现在每一家主流 AI 公司都在跑好几个爬虫、各管各的活,所以挡错那一个是代价最大的错误。挡掉 GPTBot 并不会让你从 ChatGPT 里消失——管那件事的是 OAI-SearchBot。Meta 现在有五个。而 Google 那个跟 AI 相关的令牌根本不是爬虫。
怎么核的
2026 年 8 月 15 日逐个读各家自己公布的 bot 文档,记录 robots.txt 令牌名和它自己写的用途。不用第三方名单、不用别人的转述,就是那些页面本身。
GPTBot 和 OAI-SearchBot 的区别,以及其余的地图
按公司分组。加粗的用途,是决定你今天出不出现在答案里的那些。
| 公司 | 令牌 | 干什么的 |
|---|---|---|
| OpenAI | GPTBot | 抓内容用于训练基础模型 |
OAI-SearchBot | 驱动 ChatGPT 的搜索功能。退出的站不会出现在 ChatGPT 搜索答案里 | |
ChatGPT-User | 用户发起的抓取,不是自动爬取 | |
| Anthropic | ClaudeBot | 收集可能用于训练的网页内容 |
Claude-SearchBot | 改善搜索结果质量 | |
Claude-User | 支持用户发起的、需要联网的请求 | |
| Perplexity | PerplexityBot | 让网站出现并被链接在 Perplexity 结果里。明确不用于训练基础模型 |
Perplexity-User | 用户触发的抓取,一般忽略 robots.txt | |
| Meta | Meta-WebIndexer | 改善 Meta AI 搜索结果质量 |
Meta-ExternalAgent | 训练基础模型,也做内容索引 | |
Meta-ExternalFetcher | 按用户请求抓取单个链接 | |
Meta-ExternalAds | 广告与商业产品 | |
FacebookExternalHit | 抓取被分享到 Meta 各 App 上的内容 | |
Google-Extended | 只管 Gemini 训练。不是爬虫,没有独立的 HTTP UA | |
| Apple | Applebot-Extended | 只管模型训练。不抓取网页 |
三种活,只有一种挡了会掉可见度
不按公司、改按「干什么活」分组,决定立刻就简单了。
| 活 | 令牌 | 挡掉的代价 |
|---|---|---|
| 搜索与答案 | OAI-SearchBot、Claude-SearchBot、PerplexityBot、Meta-WebIndexer | 你在那些答案里的位置。 |
| 模型训练 | GPTBot、ClaudeBot、Meta-ExternalAgent、Google-Extended、Applebot-Extended | 今天看不出任何损失。 |
| 用户触发 | ChatGPT-User、Claude-User、Perplexity-User、Meta-ExternalFetcher | 靠 robots.txt 管不住。 |
它造成的那个具体误会
最常见的版本:有人读了几条关于 AI 抓取的新闻,加上 User-agent: GPTBot 和 Disallow: /,以为自己从 ChatGPT 里退出了。他退出的是训练。ChatGPT 的搜索功能跑在 OAI-SearchBot 上,那个还开着、还在收录他——而对多数站来说,这正是他本来想要的结果。
反过来那个错误更糟:一条一刀切规则把每个令牌都网进去,为了防住一件本来也不太在意的训练,把自己从四个答案引擎里删掉了。
Meta 是最该回头看一眼的
Meta 现在记录了五个独立 agent,而喂 Meta AI 搜索结果的 Meta-WebIndexer 新到多数公开的 robots.txt 示例里都还没有它。你要是抄了一份几个月前的配置,它多半根本没提这个名字。
这也是问题的一般形状:这些名单一直在变,一份写完就不动的 robots.txt,只是某个下午的快照。
我们没有核实的部分
这些爬虫是不是真按文档行事。我们读的是各家公布的东西;没有测过一个被挡掉的令牌会不会真的停止请求,也没有任何一个挡了它们的站的服务器日志。上面每一条用途都是运营方的说法,不是我们的观察。
常见问题
你们是怎么核实的
2026 年 8 月 15 日逐个读各运营方自己的 bot 文档,令牌和用途直接取自那些页面。哪一条规则会被哪个爬虫遵守(那条分组匹配规则)在robots.txt 怎么写才管得住 AI 爬虫里。
挡掉训练类爬虫会伤到我吗
按运营方自己的描述,今天的答案里不会。那是一个关于未来模型的商业决定,不是一个可见度决定。
这份名单多久变一次
变得够频繁,以至于半年后我们不会相信任何一份它的副本——包括这一份。动手改之前先去看各家的页面。
一句话
一家公司、几个爬虫、各管各的活,而今天只有搜索那一类挡了要付代价。把这个区别落进你的 robots.txt、再推送收录,是个十分钟的活,而多数网站从来没有认真做过一次。



