x-robots-tag:27 个首页只有 1 个发了,20 个什么都没声明
x-robots-tag 是给没有 HTML 头的文件设机器人规则的唯一办法。2026-08-17 读了 27 个首页:只有 1 个发了它,20 个连 meta robots 都没有,唯二设了摘要规则的两家设的都是「不限长」。

实测 · 2026-08-17 · 30 个站 · 单次快照
样本与口径:与我们做 robots.txt、sitemap 两次调查完全相同的 30 个站。每站首页一次请求,浏览器 User-Agent,响应头与 HTML 同一次拿回,2026-08-17。3 个站拒绝了我们,分母是 27。
x-robots-tag 是响应头这一层的机器人指令,也是给 PDF、图片这类没有 HTML 头的文件设规则的唯一办法。27 个首页里正好 1 个发了它,20 个连 meta robots 都没有。而唯二设了摘要规则的两家,设的都是「不限长」——他们在把水龙头开大,不是关小。
27 个首页实际发了什么
最扎眼的是这一层有多空。绝大多数站把所有机器人指令留在默认值上,一句都没声明。
| 结果 | 站数 | 占 27 个 |
|---|---|---|
| 响应头和 meta 都没有 | 20 | 74% |
| 有 meta robots | 7 | 26% |
| 有 x-robots-tag 响应头 | 1 | 4% |
| 真的设了摘要规则 | 2 | 7% |
怎么测的
规则在抓取前写死。响应头取的是跟完重定向之后最后一跳的那份,和 HTML 在同一次请求里拿到。
- 从重定向链最后一个响应里读
x-robots-tag头。 - 从交付的 HTML 里读
<meta name="robots">。 - 两个字符串里只要出现
nosnippet或max-snippet,就算这个站设了摘要规则。
只抓首页。一个站完全可能在自己的 PDF 上发 x-robots-tag 而首页什么都不发,这个方法会把它判成没有。
七条指令,逐字照抄
7 个站带了 meta robots。下面是全部原值,一个字没改。
| 站点 | meta robots |
|---|---|
| vercel.com | index, max-image-preview:large |
| framer.com | max-image-preview:large |
| wired.com | index, follow, max-image-preview:large |
| arstechnica.com | max-snippet:-1,max-image-preview:large,max-video-preview:-1 |
| techcrunch.com | index, follow, max-image-preview:large, max-snippet:-1, max-video-preview:-1 |
| theverge.com | index,follow |
| bbc.com | noodp, noydir |
七个里有四个只是把图片预览调大。两个写着 index, follow——什么都不写就是这个结果。做出海站的人常用的 Vercel 和 Framer 都在这四个里,说明你的建站平台默认给你的就是这么一行,不是它替你想清楚了什么。
🔴 唯二设了摘要规则的两家,设的都是「不限长」
Ars Technica 和 TechCrunch 设的是 max-snippet:-1。这个 -1 的意思是不设上限——想摘多少摘多少。中文 SEO 资料里 max-snippet 几乎总是被讲成「限制摘要长度」的工具,实测里它被用成了反方向。
这一点要紧,是因为 max-snippet 同时管着 Google 的 AI 答案面能展示你多少内容。两家靠广告吃饭、被机器代答就少一次点击的出版商,明确告诉引擎「随便摘」。我们没去问他们为什么,也不打算在文章里替他们猜。
只有 BBC 用了响应头,而它的 meta 标签是化石
BBC 发的是 X-Robots-Tag: bingbot: noarchive——一条只对必应生效的指令,让它别留缓存副本。这是整个样本里唯一一条响应头指令。
它的 meta robots 写的是 noodp, noydir。这两条当年是告诉搜索引擎别用 Open Directory Project 和雅虎目录里的描述。两个目录都关停十几年了,两条指令也跟着退役。这个标签现在不起任何作用。
我们不把它叫做错误——失效指令不花钱,哪儿都会留下几条。它只是很好地说明了一个长期没人审的 head 里会攒下什么。
这次说不了的事
我们不知道这些声明有没有改变过引擎的行为。我们读到的是站方声明了什么,至于 Google、必应或任何 AI 引擎拿它做了什么,站外看不到。我们也没查非 HTML 文件——而那恰恰是 x-robots-tag 真正有用的地方:PDF 和图片没法带 meta 标签,响应头是唯一的抓手。
所以那个标题诚实的说法要更窄一些:27 个里 1 个在首页上用了这个响应头。它在别的文件类型上的使用率可能高得多,而这次抓取永远看不见。
什么时候你真的需要 x-robots-tag
它不是「更高级的 meta 标签」。它是一整类文件唯一的选择,用在别处大多只是多一个以后会忘掉的地方。
- 没有 HTML 头的文件用它——PDF、图片、纯文本、各种导出文件。
- 普通页面用 meta 标签。它更好查,团队里别人也更容易找到。
- 别指望写
index, follow能起什么作用。那是默认值,这里有两个站把它当装饰发出去。 - 别想当然认为
max-snippet是在限制。-1是不限长,而这两家出版商选的就是它。
这些指令背后的规则——到底哪一条管着 AI 答案能引用你多少——写在没有 noai,nosnippet 才是那个开关里。如果你还在决定该放行哪些爬虫,起点是robots.txt 怎么写。把这些响应头在整站范围内审一遍、包括首页抓取永远碰不到的那些文件类型,正是 QueryWin 在做的事。
常见问题
x-robots-tag 比 meta 标签优先级高吗?
两者没有谁压过谁的关系。它们是同一批指令的两条投递通道,区别在于非 HTML 文件只有响应头这一条路。
max-snippet:-1 到底有没有用?
它把一个选择显式说出来,而不是留给引擎的默认值。结果跟不写有没有差别,这次抓取答不了。
要不要学 BBC 加 noarchive?
只有当页面被缓存对你是个问题时才加。它是把窄刀,这里 27 个站有 26 个觉得用不上。
为什么那么多站设 max-image-preview:large?
七个里有四个。它让结果里能出更大的图,是一个看不出代价的可见性增益——大概正因为如此,它是唯一铺开了的指令。


