要不要屏蔽 ai 爬虫:这是三个决定,不是一个
要不要屏蔽 ai 爬虫拆开是三件事:AI 搜索收录、模型训练、用户触发的抓取。本篇给决策树、三类站各自的口径,以及为什么成本那一侧我们暂时算不出来。

要不要屏蔽 ai 爬虫,从来不是一个决定,是三个:要不要出现在 AI 搜索里、要不要被拿去训练模型、要不要伺候用户主动发起的那次抓取。多数「把 AI 挡掉了」的站,是一次性把三个都做了却没意识到;而事后最后悔的,几乎总是第一个。这一篇给决策树,以及两个方向各自搞错的代价。
读这篇前
这是 L3 那一阶的文章,讲取舍,不讲怎么动手。规则具体怎么写在robots.txt 怎么写,哪个爬虫喂哪个取材面在geo 优化的第一步。读这一篇决定你想要什么,读那两篇把它落地。
全篇有个前提:你在替一个内容公开的站做决定。如果材料在登录或付费墙后面,爬虫这个问题是排在访问控制之后的,而那个问题你已经答过了。
先把这个决定拆成三个
现在每一家厂商都把这三件事分开了,而这个分开正是「能给出一个想过的答案」的前提。屏蔽不是一个总开关,把它当总开关用,结果就是:你在 AI 搜索里消失了,同时那些本来就不看 robots.txt 的东西照抓不误。
| 决定 | 放行你得到 | 你让出什么 |
|---|---|---|
| AI 搜索收录 | 有资格被引用和链接 | 答案可能不点进来就把人满足了 |
| 模型训练 | 没有任何可观察的回报 | 你的文字进了一个你无法审计的模型 |
| 用户触发的抓取 | 那个主动来找你的人能读到页面 | 几乎没有,这次访问本来就是他要的 |
注意只有第一行是一笔真正的交易。第二行是单向的给出、没有可观察的回报,第三行几乎算不上一个决定——正因如此,把三件事捆在一起做,结果才会那么差。
第三行最简单,也最常被做错。当一个用户把你的网址贴进对话框、问「这一页讲什么」,你挡掉的那个爬虫会让他收到一句「读不了」。没有人是有意选这个结果的。
🔴 中文圈最容易踩的:一键屏蔽把三件事一起关了
这一节是中文读者独有的。国内做出海站大量用 CDN 后台那个「屏蔽 AI 爬虫」的开关,因为它一键、免费、看着安全。但那类开关按「AI 爬虫」这个大类来拦,不区分它喂的是搜索面还是训练——按下去,你同时放弃了第一行那笔本来划算的交易。
更麻烦的是它不在 robots.txt 里,所以你以后审自己的配置时看不到它。你的文件写着放行,边缘在拦,而边缘赢。要屏蔽训练就在 robots.txt 里点名训练爬虫,别用大类开关代替判断。
要不要屏蔽 ai 爬虫:决策树
四个问题,按顺序问。第一个能给出明确答案的问题,就到此为止——这里故意不做成打分表,因为这几项不是可以相加的,硬凑一个分数只会得到一个没人信的数字。
- 内容本身就是你的产品吗?如果别人付钱买的就是这些文字——研究、数据库、课程——那么开放训练等于把产品送出去。屏蔽训练,放行搜索。
- 没有点击、只被提到名字,对你还有价值吗?做品牌的、卖工具的、本地服务:在答案里被点名本身就值钱,哪怕没人点进来。搜索和用户触发都放行。
- 你的收入是按页面浏览量算的吗?广告驱动的内容站是唯一一种「问题被答完了就等于交易没了」的情形。即便如此,先看下面那两个实测结果再决定。
- 这些流量你付得起吗?抓取有真实的带宽成本。如果你的托管按流量计费而站又大,这就是一个预算问题,不是一个策略问题。
三类站,三个不同的答案
找到跟你对得上的那一行,再拿它跟上面的树对一遍。两者打架时听树的——它知道一些「品类标签」不知道的、关于你生意的事。
| 站的类型 | 搜索类爬虫 | 训练类爬虫 |
|---|---|---|
| 付费墙 / 订阅制 | 免费部分放行 | 屏蔽 |
| 原创数据 / 研究 | 放行 | 屏蔽 —— 数据就是资产 |
| 产品 / 工具 / 服务站 | 放行 | 放行,没什么要保护的 |
三类的共同模式是一样的:放行搜索几乎是白给的,真正有分歧的是训练那一栏。这也正是「两个设置互相独立」这件事之所以要紧的原因——它是「一个想过的立场」和「一刀切拒绝」之间的分界。
广告驱动的出版商实际选了什么
决策树第三问最难,所以值得看看出版商实际怎么做,而不是看道理说他们该怎么做。我们自己两次实测都碰到了这件事。
在那次 30 个站的 robots.txt 调查里,出版类站点点名 AI 爬虫的频率远高于开发工具类,而且点名几乎总是等于禁止——99 个爬虫分组里 82% 是整站禁止。也就是说,从「答案被代答就少一次点击」里损失最大的那个行业,总体上选择了挡。
但在那次 27 个首页的摘要指令调查里,唯二设了摘要规则的两家是 Ars Technica 和 TechCrunch,两家设的都是 max-snippet:-1——不限制能展示多少。两家靠广告吃饭的出版商,明确地把引擎能摘的量放开了。我们没去问他们为什么,也不打算猜。
这两个发现合不成一个统一立场,我们照实并列,而不是挑出更整齐的那一半。两篇分别是点名一个爬虫通常就等于挡掉它,以及本批那篇 x-robots-tag 普查。
成本那一侧,我们没法替你算
抓取消耗带宽,在按流量计费的托管上那是一笔真实开销。我们很想给你一个数字——AI 爬虫占请求的比例,按真实计费口径折成钱——我们没有。
这一点比听上去要紧,因为成本恰恰是这场争论里最常被空口断言的一半:它最容易讲,最难核。一个不说出处的百分比,起的是修辞作用,不是提供信息的作用。
要产出它,需要一段足够有代表性的服务器访问日志,加上各托管商真实的计费条款。这个测量已经排上,还没跑。在那之前,谁给你一个百分比,先问他:谁的日志,多长的窗口。
能告诉你的是这个检查该长什么样:把访问日志按 User-Agent 聚合,累加响应字节而不是请求数,再跟账单对。响应字节和计费流量对不上——压缩、缓存命中、边缘回源都夹在中间——所以把日志那个数当上界,不要当发票。
改回来有多难
比你希望的难,而且这件事该算进决定里,不是决定完之后才想。解除屏蔽只是改一行,但这一行要等到每个爬虫下次来读你的 robots.txt 才生效,而没有一家公开过那是多久。
我们也没测过——那个实验需要我们目前还拿不到的服务器日志。所以就当这个改动落地很慢:把屏蔽当成一个你要持有几个月的立场,不是一个边想边拨的开关。
做错了会怎样
三种都不会自己吭声。每一种都会产出一个「看起来配置好了、实际行为和主人以为的不一样」的站,所以它们能活好几个月。
- 一波新闻之后把全部挡掉。代价落在搜索面上——那正是你想要的那一半——而且落得悄无声息,没有任何东西会通知你「你不再有资格了」。
- 在 robots.txt 里挡了就以为挡住了。那是一个请求。真正执行在 CDN,两者打架的频率比人们以为的高。
- 决定一次就再不回看。厂商会加新爬虫、会改名;去年写的规则集,点的名可能今天一个都不存在了。
这一篇定不了的事
放行 AI 搜索总体上是不是让你少赚了流量,这件事没有定论,我们也没测过。诚实的说法是:被引用和被点击是两种不同的货币,哪一种要紧,取决于一个我们并不了解的商业模式。
我们也无法核实厂商关于「抓到的内容怎么用」的说法。Perplexity 声明它的搜索爬虫不用于基础模型训练,OpenAI 把自己两个爬虫记为互相独立的设置——这些是白纸黑字的声明,不是我们能审计的东西;把它们当福音或当谎言,同样都没有依据。
让这样一个决定真正被执行——robots.txt、CDN、响应头三处给出同一个答案,而且每个子域名都一致——正是 QueryWin 要查的事。
常见问题
卖广告的站要不要屏蔽 ai 爬虫?
这是「屏蔽训练」最强的理由,也是「屏蔽搜索」最弱的理由,因为被引用至少还带着你的名字。我们的实测里出版商总体在挡,同时其中两家把摘要放开到不限长——这个行业自己也没定论。
挡了到底挡不挡得住?
挡得住那些遵守 robots.txt 的爬虫。对不遵守的一点作用都没有——这正是为什么在网络边缘执行是另一根、也更硬的杠杆。
屏蔽训练会不会连 AI 搜索的可见性一起丢掉?
在厂商把两个设置记为独立的地方不会,OpenAI 就是明写的。前提是你点对了爬虫的名字,而点错名字正是这件事最常见的错法。
能不能只放行一部分?
能,而且一个想过的答案本来就长这样。按「每个爬虫喂的是哪个面」来分组,不要按「它属于哪家公司」来分。
多久该回看一次?
厂商发布新爬虫的时候,以及一个你真的守得住的固定周期。一份一年没人读过的规则集,等于没有人在做这个决定。
本文属于 QueryWin 实操手册 · 第 3 阶


