meta robots:28 个首页只有 7 个写了,其中两条指令十来年前就死了

meta robots 标签实测:30 个站的首页,28 个读得到,只有 7 个写了这个标签,没有一个用 noindex,三个把它花在等于没写的默认值上,只有两个管了 AI 答案能摘多少。

抓取与收录5 分钟读完2476 次阅读
meta robots:28 个首页只有 7 个写了,其中两条指令十来年前就死了

实测 · 2026-08-19 · 30 个站 · 单次快照

样本与口径:与我们此前 robots.txt、sitemap、首页结构、请求链四轮实测同一批 30 个站。每个站首页请求一次,浏览器 UA,跟随跳转,2026-08-19,出口在日本大阪。两个站拒绝了我们,所以分母是 28。

28 个首页里只有 7 个写了 meta robots 标签。7 个里没有一个用 noindex,这在意料之中。意料之外的是:其中三个把这个标签花在了 index, follow 上,而 Google 自己的文档说这等于没写;还有一个站挂着两条已经死了十来年的指令。

怎么测的

口径在跑之前定死,跑完没改。

  1. 用桌面浏览器 UA 请求一次首页,跟随跳转。
  2. 把下发的 <head> 里所有 namerobotsgooglebotgooglebingbotgoogle-extended<meta> 都读出来。
  3. content 的值原样记下,含空格和大小写。

不渲染。JavaScript 注入的标签我们数不到,而首页上这种做法确实存在。

七条声明,全在这儿

这是我们在样本里找到的全部 robots 指令,逐字照抄。

站点content 的值
techcrunch.comindex, follow, max-image-preview:large, max-snippet:-1, max-video-preview:-1
arstechnica.commax-snippet:-1,max-image-preview:large,max-video-preview:-1
www.wired.comindex, follow, max-image-preview:large
vercel.comindex, max-image-preview:large
www.framer.commax-image-preview:large
www.theverge.comindex,follow
www.bbc.comNOODP, NOYDIR

剩下 21 个首页什么都没声明。对一个你希望被收录的页面来说,这才是对的默认状态。这里的「没有」不是疏忽。

写下去的东西有一半不起作用

Google 列出的有效指令一共十二条:allnoindexnofollownonenosnippetindexifembeddedmax-snippetmax-image-previewmax-video-previewnotranslatenoimageindexunavailable_after。这份列表和下面引的每一句 Google 原文,都是 2026-08-19 在 developers.google.com 的 robots meta 标签规范页上读的。

indexfollow 不在里面。对应的是 all,而 Google 对它的说明少见地直白:There are no restrictions for indexing or serving. This rule is the default value and has no effect if explicitly listed.(对收录和展示没有任何限制。这条规则就是默认值,显式写出来不产生任何效果。)七个站里有四个照样写了 index,其中三个还带着 follow

BBC 那一对来得更远。NOODPNOYDIR 当年是用来告诉搜索引擎别拿 Open Directory Project 和 Yahoo 目录的描述当摘要的,而这两个目录都已经不存在了。这两个词在 Google 现行文档里一个字都找不到。那是一块化石,挂在全世界被抓得最勤的首页之一上。

把默认值写进指令里,不会让它更有力,只会让标签更长。

只有两个站在管那条真正通到 AI 答案的指令

max-snippet:-1 在样本里只出现在两个首页上:arstechnica.com 和 techcrunch.com。两家都是出版商,而且两家都是在放开上限而不是收紧——-1 的意思是不设限。

对任何在意被 AI 引用的人来说,这是最要紧的一条指令,而这话是 Google 自己在定义里说的。max-snippet applies to all forms of search results (such as Google web search, Google Images, Discover, Assistant, AI Overviews, AI Mode) and will also limit how much of the content may be used as a direct input for AI Overviews and AI Mode.(适用于所有形式的搜索结果,包括网页搜索、图片、Discover、Assistant、AI Overviews 和 AI Mode,并且会限制其中多少内容可以被直接用作 AI Overviews 与 AI Mode 的输入。)

所以真正该看的数不是 7/28,是 2/28——这批首页里,只有两个对「AI 答案可以用我多少内容」做过明确表态。剩下 26 个把这件事交给了 Google。

做出海的话,这个 2/28 就是你的机会

你的对手大概率也没设。这不是说你该把它开到 -1——那是一个取舍:放开摘要长度会让更多内容被摘走,也让你更容易成为被引用的那一个。要紧的是这个决定该由你做,而不是默认落在那儿。

旁边还有一个坑要说清楚。Google 写着 in the case of conflicting robots rules, the more restrictive rule applies. For example, if a page has both max-snippet:50 and nosnippet rules, the nosnippet rule will apply.(robots 规则冲突时,以更严格的那条为准。比如一个页面同时有 max-snippet:50 和 nosnippet,那么生效的是 nosnippet。)在一个地方写得再宽松,也扛不住另一个地方的一条严格规则——包括 HTTP 响应头,而我们上一批实测发现那一层几乎是空的。

有一条指令我们查不到出处

Wired 还多发了一条:<meta name="google" content="nopagereadaloud">。它不在上面引的那份有效指令列表里,我们也没有继续去追它还在哪儿被文档化、现在是不是还生效。记下来是因为它确实在那儿,不是因为我们能告诉你它今天做什么。

这七条里哪些是有意为之、哪些是建站系统默认吐出来的,我们分不清。max-image-preview:large 在七个里出现了五次,这种整齐度通常意味着是某个内容管理系统写的。从站外看,没有办法把「策略」和「继承来的默认值」分开。

你自己的 meta robots 标签该怎么办

两个该做的,两个别做的。

  • 不需要限制什么就别写。默认值本来就是多数页面想要的,这 28 个站里有 21 个就是这么做的。
  • 关于 max-snippet 要认真做一次决定,它是这里唯一一条管着「AI 答案能用你多少文字」的指令。
  • 别写 index, follow。Google 文档写明默认值显式列出来不产生任何效果。
  • 别因为「本来就在那儿」就留着一条指令。这批站里有一条 NOODP,比它指向的那个目录多活了将近十年。

响应头和 HTML 都要查,因为两边可能不一致,而更严格的那条会赢。如果你在 CDN 或反向代理上加过响应头,尤其要看一眼。至于爬虫够不够得着、读不读得到承载这些声明的页面,那是另一个问题,用 AI 爬虫可达性检查器去看。

同一组指令写在响应头里的比例有多低,在 x-robots-tag:27 个首页只有 1 个发了那篇。为什么控 AI 引用的是摘要长度、而不是某个想象中的「禁止 AI」开关,在根本没有 noai 指令那篇。

常见问题

你们是怎么测的

2026-08-19,每个站首页请求一次,桌面浏览器 UA,跟随跳转,出口在日本。从下发的 head 里读出所有 robots 系列的 meta 元素,content 原样记录。不渲染,所以前端注入的标签会漏掉。

首页需要写 meta robots 吗

只有要限制什么的时候才需要。这 28 个首页里 21 个什么都没写,对一个你希望进搜索结果的页面来说,那就是对的。

index, follow 有用吗

没用。Google 把 all 记为默认值并说显式写出来不产生效果,而 indexfollow 压根不在它的有效指令列表里。

哪条指令影响 AI Overviews

max-snippetnosnippet。Google 的定义里写明这两条适用于 AI Overviews 和 AI Mode,并限制页面内容能被直接用作输入的量。

响应头和 HTML 冲突了怎么办

以更严格的那条为准。Google 直接给了例子:同时有 max-snippet:50nosnippet,生效的是 nosnippet

meta robots:28 个首页只有 7 个写了,其中两条指令十来年前就死了