谁在挡 AI 爬虫、谁在发 llms.txt:30 个站,两种相反的策略

30 个知名站的 robots.txt 与 llms.txt 实测:新闻出版类成打点名 AI 爬虫、一个 llms.txt 都不发;开发工具类正好相反。

抓取与收录4 分钟读完2818 次阅读
谁在挡 AI 爬虫、谁在发 llms.txt:30 个站,两种相反的策略

实测 · 2026-08-15 · 30 个网站 · 单次快照

样本与口径:30 个知名公网站点。2026 年 8 月 15 日用 OAI-SearchBot 的 UA 各取一次 /robots.txt/llms.txt,并统计 16 个已知 AI 爬虫里,有哪些在 robots.txt 里拥有自己独立的 User-agent: 分组。

谁在挡 AI 爬虫,几乎完全取决于这个站卖的是什么,而且出现了两种完全相反的做法。新闻出版类在 robots.txt 里成打地点名 AI 爬虫,一个 llms.txt 都不发;开发工具与 SaaS 公司发 llms.txt,一个 AI 爬虫都不点名。29 份可读的 robots.txt 里,13 份至少点名过一个;30 个站里 14 个返回了真的 llms.txt。

怎么测的

每站每个文件请求一次,不渲染、不重试。只有当某个爬虫拥有自己独立的 User-agent: 行时,才算这个站「点名」了它——我们没有去解读下面那些规则是允许还是禁止,因为这里有意思的信号是「有没有人专门为它写一行」。顺带一提,加一个指名分组的影响比看上去大,见robots.txt 怎么写才管得住 AI 爬虫

llms.txt 要求同时满足 200 并且 返回体不是 HTML,因为单页应用会很乐意把自己的首页返回给任何路径。这个样本里这个坑没有触发:每一个 200 都是真的文本文件。

谁在挡 AI 爬虫:出版类

这一组每个站都点名了大量 AI 爬虫,而且没有一个发 llms.txt。

网站点名的 AI 爬虫数llms.txt
nytimes.com16403
theverge.com14404
wired.com13404
arstechnica.com13404
bbc.com13404
medium.com7403
techcrunch.com7404

点名 16 个不是谁随手弄出来的配置。那是一份有人维护的名单,新爬虫出现就往里加——意味着这些机构里有人专门管这个文件。

开发工具公司

同样的测量,相反的结果。

网站点名的 AI 爬虫数llms.txt
nextjs.org0
stripe.com0
vercel.com0
linear.app0
slack.com0
railway.com0
framer.com0
webflow.com0
shopify.com0
github.com0

十个站,加起来点名 0 个 AI 爬虫,而且每一个都有 llms.txt。还有几个居中:netlify.com 点名 6 个并发了一份,cloudflare.com 点名 5 个并发了一份,supabase.com 点名 4 个,notion.com 点名 3 个。

为什么这个分野说得通

它是从各自卖什么推出来的。出版机构的产品就是那篇文章,所以一个拿它训练出来的模型是在跟它抢生意。开发工具公司的产品是工具,被 AI 答案准确引用等于免费分发——文档是营销物料,不是存货。

也就是说,那句到处流传的「把 AI 爬虫挡掉」根本不是建议。它是一个行业的答案,被拿去对所有人重复。

我们没有找到的东西

这个样本里没有一个站两样都做得很足——没有谁一边发着详细的 llms.txt、一边挡着一长串爬虫。我们本来预期会有几个,因为这两个文件管的是不同的事,合起来用完全说得通。30 个站远远太少,不足以断言没人这么做。

我们也看不见意图。一个没点名任何 AI 爬虫的站,可能是想清楚了决定全放行,也可能是压根没想过这件事。这两种从外面看一模一样,这份测量分不开——这是整件事最大的局限。

被点名最多的几个

29 份可读文件里,作为独立分组出现最多的是这些。

爬虫点名它的站数
ClaudeBot11
GPTBot10
PerplexityBot10
Google-Extended10
CCBot9
Applebot-Extended8
Bytespider8
Amazonbot7
ChatGPT-User7
Perplexity-User6

排在前面的是训练类爬虫。这跟上面那个出版动机是一致的,也意味着这些文件多数是为了回答「训练」那个问题写的,不是为了回答「可见性」那个问题。

有一个站用玩笑回应

stackoverflow.com 对我们请求 robots.txt 返回了 418。那个状态码是 1998 年的愚人节玩笑「我是茶壶」,用在这里是一次带着挤眼的拒绝。我们读不到它的文件,所以它没有算进那 29 个里。

常见问题

你们是怎么测的

每站两次 GET,UA 用 OAI-SearchBot,然后对 16 个爬虫名各做一次「独立 User-agent: 行」的正则匹配。原始结果随文存了一份 JSON。任何人都能重跑,每个站两行 shell 的事。

点名了就等于挡掉了吗

不等于,而且我们刻意没测这个。一个被点名的分组可以是放行、可以限制某些路径、也可以设抓取延迟。我们数的是「有没有被专门关注」,不是「许不许」。

我该照出版类那样配吗

只有当你卖的东西跟他们一样时才该。如果你的页面存在的目的是把人带到一个产品那儿,出版类那套配置会把你从「这些人现在提问的地方」删掉。

一句话

30 个知名站,两种各自自洽且完全相反的策略,中间没有重叠。抄任何一种之前,先想清楚你手上是哪一种产品。内容本身就是别人付钱买的东西,那出版类是你的参照;内容是别人找到你产品的路径,那挡掉就是很贵的选项——而把这个决定做完、发出去、再推送收录,才是真正改变什么的那一步。

谁在挡 AI 爬虫、谁在发 llms.txt:30 个站,两种相反的策略