谁在挡 AI 爬虫、谁在发 llms.txt:30 个站,两种相反的策略
30 个知名站的 robots.txt 与 llms.txt 实测:新闻出版类成打点名 AI 爬虫、一个 llms.txt 都不发;开发工具类正好相反。

实测 · 2026-08-15 · 30 个网站 · 单次快照
样本与口径:30 个知名公网站点。2026 年 8 月 15 日用 OAI-SearchBot 的 UA 各取一次 /robots.txt 与 /llms.txt,并统计 16 个已知 AI 爬虫里,有哪些在 robots.txt 里拥有自己独立的 User-agent: 分组。
谁在挡 AI 爬虫,几乎完全取决于这个站卖的是什么,而且出现了两种完全相反的做法。新闻出版类在 robots.txt 里成打地点名 AI 爬虫,一个 llms.txt 都不发;开发工具与 SaaS 公司发 llms.txt,一个 AI 爬虫都不点名。29 份可读的 robots.txt 里,13 份至少点名过一个;30 个站里 14 个返回了真的 llms.txt。
怎么测的
每站每个文件请求一次,不渲染、不重试。只有当某个爬虫拥有自己独立的 User-agent: 行时,才算这个站「点名」了它——我们没有去解读下面那些规则是允许还是禁止,因为这里有意思的信号是「有没有人专门为它写一行」。顺带一提,加一个指名分组的影响比看上去大,见robots.txt 怎么写才管得住 AI 爬虫。
llms.txt 要求同时满足 200 并且 返回体不是 HTML,因为单页应用会很乐意把自己的首页返回给任何路径。这个样本里这个坑没有触发:每一个 200 都是真的文本文件。
谁在挡 AI 爬虫:出版类
这一组每个站都点名了大量 AI 爬虫,而且没有一个发 llms.txt。
| 网站 | 点名的 AI 爬虫数 | llms.txt |
|---|---|---|
| nytimes.com | 16 | 403 |
| theverge.com | 14 | 404 |
| wired.com | 13 | 404 |
| arstechnica.com | 13 | 404 |
| bbc.com | 13 | 404 |
| medium.com | 7 | 403 |
| techcrunch.com | 7 | 404 |
点名 16 个不是谁随手弄出来的配置。那是一份有人维护的名单,新爬虫出现就往里加——意味着这些机构里有人专门管这个文件。
开发工具公司
同样的测量,相反的结果。
| 网站 | 点名的 AI 爬虫数 | llms.txt |
|---|---|---|
| nextjs.org | 0 | 有 |
| stripe.com | 0 | 有 |
| vercel.com | 0 | 有 |
| linear.app | 0 | 有 |
| slack.com | 0 | 有 |
| railway.com | 0 | 有 |
| framer.com | 0 | 有 |
| webflow.com | 0 | 有 |
| shopify.com | 0 | 有 |
| github.com | 0 | 有 |
十个站,加起来点名 0 个 AI 爬虫,而且每一个都有 llms.txt。还有几个居中:netlify.com 点名 6 个并发了一份,cloudflare.com 点名 5 个并发了一份,supabase.com 点名 4 个,notion.com 点名 3 个。
为什么这个分野说得通
它是从各自卖什么推出来的。出版机构的产品就是那篇文章,所以一个拿它训练出来的模型是在跟它抢生意。开发工具公司的产品是工具,被 AI 答案准确引用等于免费分发——文档是营销物料,不是存货。
也就是说,那句到处流传的「把 AI 爬虫挡掉」根本不是建议。它是一个行业的答案,被拿去对所有人重复。
我们没有找到的东西
这个样本里没有一个站两样都做得很足——没有谁一边发着详细的 llms.txt、一边挡着一长串爬虫。我们本来预期会有几个,因为这两个文件管的是不同的事,合起来用完全说得通。30 个站远远太少,不足以断言没人这么做。
我们也看不见意图。一个没点名任何 AI 爬虫的站,可能是想清楚了决定全放行,也可能是压根没想过这件事。这两种从外面看一模一样,这份测量分不开——这是整件事最大的局限。
被点名最多的几个
29 份可读文件里,作为独立分组出现最多的是这些。
| 爬虫 | 点名它的站数 |
|---|---|
ClaudeBot | 11 |
GPTBot | 10 |
PerplexityBot | 10 |
Google-Extended | 10 |
CCBot | 9 |
Applebot-Extended | 8 |
Bytespider | 8 |
Amazonbot | 7 |
ChatGPT-User | 7 |
Perplexity-User | 6 |
排在前面的是训练类爬虫。这跟上面那个出版动机是一致的,也意味着这些文件多数是为了回答「训练」那个问题写的,不是为了回答「可见性」那个问题。
有一个站用玩笑回应
stackoverflow.com 对我们请求 robots.txt 返回了 418。那个状态码是 1998 年的愚人节玩笑「我是茶壶」,用在这里是一次带着挤眼的拒绝。我们读不到它的文件,所以它没有算进那 29 个里。
常见问题
你们是怎么测的
每站两次 GET,UA 用 OAI-SearchBot,然后对 16 个爬虫名各做一次「独立 User-agent: 行」的正则匹配。原始结果随文存了一份 JSON。任何人都能重跑,每个站两行 shell 的事。
点名了就等于挡掉了吗
不等于,而且我们刻意没测这个。一个被点名的分组可以是放行、可以限制某些路径、也可以设抓取延迟。我们数的是「有没有被专门关注」,不是「许不许」。
我该照出版类那样配吗
只有当你卖的东西跟他们一样时才该。如果你的页面存在的目的是把人带到一个产品那儿,出版类那套配置会把你从「这些人现在提问的地方」删掉。
一句话
30 个知名站,两种各自自洽且完全相反的策略,中间没有重叠。抄任何一种之前,先想清楚你手上是哪一种产品。内容本身就是别人付钱买的东西,那出版类是你的参照;内容是别人找到你产品的路径,那挡掉就是很贵的选项——而把这个决定做完、发出去、再推送收录,才是真正改变什么的那一步。



