多数首页根本没有结构化数据:14 个里 9 个
以 AI 爬虫身份抓了 14 个知名首页,9 个交付了零个 JSON-LD 块。这条线比铺天盖地的 schema 教程暗示的低得多。

实测 · 2026-08-15 · 15 个网站 · 单次快照
样本与口径:沿用渲染那次测量的同一批 15 次首页抓取,重新检查 JSON-LD。UA 用 OAI-SearchBot,2026 年 8 月 15 日,统计交付的 HTML 里 application/ld+json 块的数量。
多数首页根本没有结构化数据。返回了页面的 14 个站里,9 个交付了 0 个 JSON-LD 块。有的那 5 个带了一到三块。这些都是有专职前端团队的公司,而其中多数发出去的首页,关于「自己是谁」没有任何机器可读的说明。
怎么测的
数的是交付的 HTML 里 application/ld+json 出现的次数——不是渲染后的。这个区别要紧:用 JavaScript 注入的块在这里不会被算进去,而它同样不会被任何不渲染的爬虫看到。
我们没有校验内容。一个带三块的站,可能三块都是坏的。这只量了「有没有」,是最弱的一种主张,而结果仍然值得一看。
多数首页根本没有结构化数据:逐站计数
按交付 HTML 里的块数从多到少排。
| 网站 | JSON-LD 块数 |
|---|---|
| discord.com | 3 |
| railway.com | 3 |
| figma.com | 2 |
| stripe.com | 1 |
| framer.com | 1 |
| webflow.com | 1 |
| nextjs.org · mozilla.org · vercel.com · linear.app · notion.com · slack.com · canva.com · supabase.com | 0 |
| airbnb.com | 403 — 没返回页面 |
为什么这件事值得知道
结构化数据是页面上唯一一处不需要解读就能说明「谁发布的、这是什么」的地方。其余一切,引擎都得从行文里去推。
实际的读法不是「这些公司做错了」。是这条线比铺天盖地的教程暗示的要低得多。如果多数资源充足的首页什么都没带,一个小站带一段准确的 Organization,不是落后——在这个只要一小时的信号上,它已经领先这份名单里的多数。
而多数教程讲的那两种早就没了
值得跟这件事一起看:HowTo 结构化数据在 2023 年 9 月被弃用,FAQPage 在 2026 年 6 月被从 Google 搜索里移除。两者都不在 Google 当前支持的富结果类型清单里。大量已发布的 schema 教程,讲的是两个在 Google 里已经不产生任何东西的类型。
该加哪四段、以及那条会招致人工处罚的规矩,在结构化数据怎么加里写全了。
这份测量说明不了什么
有不等于对,首页不等于整站,一次请求也不等于一个规律。这里面好几家几乎可以肯定在产品页或文章模板上带着结构化数据、只是首页是光的——那会是个说得通的选择,而这份测量看不见。
我们也说不了它影不影响被引用。没有引擎公布过自己怎么给结构化数据加权,我们也没跑过对照实验。任何给你一个百分比的人都是在猜。
常见问题
你们是怎么测的
每个首页一条 curl,UA 用 OAI-SearchBot,然后数响应体里 application/ld+json 出现的次数。两行 shell。同一次抓取也产出了AI 爬虫从前端渲染的网站上拿到了什么里的可读正文数字。
0 块是不是说明这个站到处都没有结构化数据
不是。只说明首页没交付。文章和产品模板才是更常放的地方,而这份样本没看那些。
小站只加一段的话加哪个
首页的 Organization,sameAs 指向你其他已验证的主页。这是把实体身份钉死的那一段,而实体身份正是引擎最需要、又最常只能靠猜的事实。
一个数
14 个知名首页里 9 个交付了零结构化数据。这条线很低,跨过去只要一小时——写那一段、发出去、再推送收录。



