多数首页根本没有结构化数据:14 个里 9 个

以 AI 爬虫身份抓了 14 个知名首页,9 个交付了零个 JSON-LD 块。这条线比铺天盖地的 schema 教程暗示的低得多。

抓取与收录3 分钟读完925 次阅读
多数首页根本没有结构化数据:14 个里 9 个

实测 · 2026-08-15 · 15 个网站 · 单次快照

样本与口径:沿用渲染那次测量的同一批 15 次首页抓取,重新检查 JSON-LD。UA 用 OAI-SearchBot,2026 年 8 月 15 日,统计交付的 HTML 里 application/ld+json 块的数量。

多数首页根本没有结构化数据。返回了页面的 14 个站里,9 个交付了 0 个 JSON-LD 块。有的那 5 个带了一到三块。这些都是有专职前端团队的公司,而其中多数发出去的首页,关于「自己是谁」没有任何机器可读的说明。

怎么测的

数的是交付的 HTML 里 application/ld+json 出现的次数——不是渲染后的。这个区别要紧:用 JavaScript 注入的块在这里不会被算进去,而它同样不会被任何不渲染的爬虫看到。

我们没有校验内容。一个带三块的站,可能三块都是坏的。这只量了「有没有」,是最弱的一种主张,而结果仍然值得一看。

多数首页根本没有结构化数据:逐站计数

按交付 HTML 里的块数从多到少排。

网站JSON-LD 块数
discord.com3
railway.com3
figma.com2
stripe.com1
framer.com1
webflow.com1
nextjs.org · mozilla.org · vercel.com · linear.app · notion.com · slack.com · canva.com · supabase.com0
airbnb.com403 — 没返回页面

为什么这件事值得知道

结构化数据是页面上唯一一处不需要解读就能说明「谁发布的、这是什么」的地方。其余一切,引擎都得从行文里去推。

实际的读法不是「这些公司做错了」。是这条线比铺天盖地的教程暗示的要低得多。如果多数资源充足的首页什么都没带,一个小站带一段准确的 Organization,不是落后——在这个只要一小时的信号上,它已经领先这份名单里的多数。

而多数教程讲的那两种早就没了

值得跟这件事一起看:HowTo 结构化数据在 2023 年 9 月被弃用,FAQPage 在 2026 年 6 月被从 Google 搜索里移除。两者都不在 Google 当前支持的富结果类型清单里。大量已发布的 schema 教程,讲的是两个在 Google 里已经不产生任何东西的类型。

该加哪四段、以及那条会招致人工处罚的规矩,在结构化数据怎么加里写全了。

这份测量说明不了什么

有不等于对,首页不等于整站,一次请求也不等于一个规律。这里面好几家几乎可以肯定在产品页或文章模板上带着结构化数据、只是首页是光的——那会是个说得通的选择,而这份测量看不见。

我们也说不了它影不影响被引用。没有引擎公布过自己怎么给结构化数据加权,我们也没跑过对照实验。任何给你一个百分比的人都是在猜。

常见问题

你们是怎么测的

每个首页一条 curl,UA 用 OAI-SearchBot,然后数响应体里 application/ld+json 出现的次数。两行 shell。同一次抓取也产出了AI 爬虫从前端渲染的网站上拿到了什么里的可读正文数字。

0 块是不是说明这个站到处都没有结构化数据

不是。只说明首页没交付。文章和产品模板才是更常放的地方,而这份样本没看那些。

小站只加一段的话加哪个

首页的 OrganizationsameAs 指向你其他已验证的主页。这是把实体身份钉死的那一段,而实体身份正是引擎最需要、又最常只能靠猜的事实。

一个数

14 个知名首页里 9 个交付了零结构化数据。这条线很低,跨过去只要一小时——写那一段、发出去、再推送收录