点名一个爬虫通常就等于挡掉它:99 个分组里 82 个

14 个站的 99 个点名分组里,82 个是整站禁止。但有三个站点了名一个都没挡——只数点名数,等于把两个相反的决定混成一个数字。

抓取与收录3 分钟读完2822 次阅读
点名一个爬虫通常就等于挡掉它:99 个分组里 82 个

实测 · 2026-08-15 · 14 个网站 · 99 个点名分组

样本与口径:14 个在 robots.txt 里点名 AI 爬虫的知名站点。2026 年 8 月 15 日用 OAI-SearchBot 的 UA 各抓一次文件,解析分组,逐个判断被点名的爬虫拿到的是整站 Disallow: /,还是只有路径级规则。

点名一个爬虫通常就等于挡掉它:99 个点名分组里,82 个(82%)是整站 Disallow: /但那个例外不是噪声——有三个站点了名却一个都没挡,把分组用来限定路径。只数「点了几个名」,等于把两个相反的决定混成一个数字。

怎么测的

把每份 robots.txt 解析成分组,连续的 User-agent: 行视为共用下面那套规则,然后对每个被点名的 AI 爬虫问一个问题:这一组里有没有 Disallow: /,而且没有别的东西把它放回来?

这是刻意做糙的。它没有实现 Allow 覆盖和通配符优先级,所以一个先全禁、再放开某个子目录的分组,在这里会被算成整站禁止。这会低估开放程度,不会高估。

点名一个爬虫通常就等于挡掉它:逐站

按点名数量排。最后三行是那个例外。

网站点名整站禁止只限路径
nytimes.com11101
theverge.com1082
bbc.com10100
wired.com990
arstechnica.com990
patreon.com990
figma.com770
canva.com761
techcrunch.com660
medium.com660
netlify.com505
cloudflare.com404
supabase.com404
notion.com220

这是两个人群,不是一个分布

82% 是在两个行为完全不同的群体上取的平均。十个站把点到的几乎全挡了。三个站点了名却一个都没挡——netlify.comcloudflare.comsupabase.com 用指名分组,纯粹是为了限定某个爬虫能走哪些路径。

所以一份「有多少站点名了 AI 爬虫」的调查,是在用一个数字量两个相反的决定。一个站点五个名字是为了把它们挡在 /admin/ 外面,另一个站点五个名字是为了把它们整个挡在外面,这是反着的。

读任何人的 robots.txt 时该注意什么

包括同行的。一个指名分组的存在,只说明有人想过这件事。它下面那几行才说明他决定了什么,而那几行比多数人会看的位置再往下两行。

这同样适用于你自己那份被模板或平台默认值动过的文件:一个不是你写的指名分组,可能是在放行而不是在限制,也可能反过来。

这份测量说明不了什么

14 个站、一次快照、一个没有实现完整优先级规则的解析器。它也看不见意图——整站禁止可能是深思熟虑的政策,也可能是抄来的模板,从外面看一模一样。

我们也没有查任何爬虫是不是真的遵守这些文件。那需要服务器日志,而别人站点的日志我们没有。

常见问题

你们是怎么测的

每站一条 curl,一个把连续 User-agent: 行和下面规则归组的小解析器,然后逐个爬虫检查有没有 Disallow: /。原始输出随文存了一份。

整站禁止和路径规则的区别为什么这么要紧

因为一个把你从一个答案引擎里整个删掉,另一个不会。你要是在抄一个你欣赏的站的配置,这个区别就是整份配置。

82% 算高还是低

算高,而且它同时是「谁会去点名」这件事的产物。出版类会点名也会挡;多数别的站根本不点名。这个 82% 描述的是点名人群,不是整个互联网。

一个数

99 个被点名的 AI 爬虫分组里,82 个是整站禁止——但 14 个站里有 3 个,点了名一个都没挡。抄任何人的 robots.txt 之前,往下多读两行,然后发自己那版、再推送收录。谁在点名谁的那份拆解在谁在挡 AI 爬虫、谁在发 llms.txt

点名一个爬虫通常就等于挡掉它:99 个分组里 82 个