x-robots-tag:27 个首页只有 1 个发了,20 个什么都没声明

x-robots-tag 是给没有 HTML 头的文件设机器人规则的唯一办法。2026-08-17 读了 27 个首页:只有 1 个发了它,20 个连 meta robots 都没有,唯二设了摘要规则的两家设的都是「不限长」。

抓取与收录4 分钟读完1130 次阅读
x-robots-tag:27 个首页只有 1 个发了,20 个什么都没声明

实测 · 2026-08-17 · 30 个站 · 单次快照

样本与口径:与我们做 robots.txt、sitemap 两次调查完全相同的 30 个站。每站首页一次请求,浏览器 User-Agent,响应头与 HTML 同一次拿回,2026-08-17。3 个站拒绝了我们,分母是 27。

x-robots-tag 是响应头这一层的机器人指令,也是给 PDF、图片这类没有 HTML 头的文件设规则的唯一办法。27 个首页里正好 1 个发了它,20 个连 meta robots 都没有。而唯二设了摘要规则的两家,设的都是「不限长」——他们在把水龙头开大,不是关小。

27 个首页实际发了什么

最扎眼的是这一层有多空。绝大多数站把所有机器人指令留在默认值上,一句都没声明。

结果站数占 27 个
响应头和 meta 都没有2074%
有 meta robots726%
有 x-robots-tag 响应头14%
真的设了摘要规则27%

怎么测的

规则在抓取前写死。响应头取的是跟完重定向之后最后一跳的那份,和 HTML 在同一次请求里拿到。

  1. 从重定向链最后一个响应里读 x-robots-tag 头。
  2. 从交付的 HTML 里读 <meta name="robots">
  3. 两个字符串里只要出现 nosnippetmax-snippet,就算这个站设了摘要规则。

只抓首页。一个站完全可能在自己的 PDF 上发 x-robots-tag 而首页什么都不发,这个方法会把它判成没有。

七条指令,逐字照抄

7 个站带了 meta robots。下面是全部原值,一个字没改。

站点meta robots
vercel.comindex, max-image-preview:large
framer.commax-image-preview:large
wired.comindex, follow, max-image-preview:large
arstechnica.commax-snippet:-1,max-image-preview:large,max-video-preview:-1
techcrunch.comindex, follow, max-image-preview:large, max-snippet:-1, max-video-preview:-1
theverge.comindex,follow
bbc.comnoodp, noydir

七个里有四个只是把图片预览调大。两个写着 index, follow——什么都不写就是这个结果。做出海站的人常用的 Vercel 和 Framer 都在这四个里,说明你的建站平台默认给你的就是这么一行,不是它替你想清楚了什么。

🔴 唯二设了摘要规则的两家,设的都是「不限长」

Ars Technica 和 TechCrunch 设的是 max-snippet:-1。这个 -1 的意思是不设上限——想摘多少摘多少。中文 SEO 资料里 max-snippet 几乎总是被讲成「限制摘要长度」的工具,实测里它被用成了反方向。

这一点要紧,是因为 max-snippet 同时管着 Google 的 AI 答案面能展示你多少内容。两家靠广告吃饭、被机器代答就少一次点击的出版商,明确告诉引擎「随便摘」。我们没去问他们为什么,也不打算在文章里替他们猜。

只有 BBC 用了响应头,而它的 meta 标签是化石

BBC 发的是 X-Robots-Tag: bingbot: noarchive——一条只对必应生效的指令,让它别留缓存副本。这是整个样本里唯一一条响应头指令。

它的 meta robots 写的是 noodp, noydir。这两条当年是告诉搜索引擎别用 Open Directory Project 和雅虎目录里的描述。两个目录都关停十几年了,两条指令也跟着退役。这个标签现在不起任何作用。

我们不把它叫做错误——失效指令不花钱,哪儿都会留下几条。它只是很好地说明了一个长期没人审的 head 里会攒下什么。

这次说不了的事

我们不知道这些声明有没有改变过引擎的行为。我们读到的是站方声明了什么,至于 Google、必应或任何 AI 引擎拿它做了什么,站外看不到。我们也没查非 HTML 文件——而那恰恰是 x-robots-tag 真正有用的地方:PDF 和图片没法带 meta 标签,响应头是唯一的抓手。

所以那个标题诚实的说法要更窄一些:27 个里 1 个在首页上用了这个响应头。它在别的文件类型上的使用率可能高得多,而这次抓取永远看不见。

什么时候你真的需要 x-robots-tag

它不是「更高级的 meta 标签」。它是一整类文件唯一的选择,用在别处大多只是多一个以后会忘掉的地方。

  • 没有 HTML 头的文件用它——PDF、图片、纯文本、各种导出文件。
  • 普通页面用 meta 标签。它更好查,团队里别人也更容易找到。
  • 别指望写 index, follow 能起什么作用。那是默认值,这里有两个站把它当装饰发出去。
  • 别想当然认为 max-snippet 是在限制。-1 是不限长,而这两家出版商选的就是它。

这些指令背后的规则——到底哪一条管着 AI 答案能引用你多少——写在没有 noai,nosnippet 才是那个开关里。如果你还在决定该放行哪些爬虫,起点是robots.txt 怎么写。把这些响应头在整站范围内审一遍、包括首页抓取永远碰不到的那些文件类型,正是 QueryWin 在做的事。

常见问题

x-robots-tag 比 meta 标签优先级高吗?

两者没有谁压过谁的关系。它们是同一批指令的两条投递通道,区别在于非 HTML 文件只有响应头这一条路。

max-snippet:-1 到底有没有用?

它把一个选择显式说出来,而不是留给引擎的默认值。结果跟不写有没有差别,这次抓取答不了。

要不要学 BBC 加 noarchive?

只有当页面被缓存对你是个问题时才加。它是把窄刀,这里 27 个站有 26 个觉得用不上。

为什么那么多站设 max-image-preview:large?

七个里有四个。它让结果里能出更大的图,是一个看不出代价的可见性增益——大概正因为如此,它是唯一铺开了的指令。

x-robots-tag:27 个首页只有 1 个发了,20 个什么都没声明