你的文档页比首页还空:10 个站里 7 个
10 个知名站实测:7 个的文档页交付给 AI 爬虫的可读正文比营销首页还少。linear.app 的文档只有首页的八分之一。

实测 · 2026-08-15 · 10 个网站 · 单次快照
样本与口径:10 个知名网站。每站各取一次首页和一个文档/帮助页,UA 用 OAI-SearchBot,2026 年 8 月 15 日发出;剥掉脚本和标签后按字符数比较可读正文。
你的文档页比首页还空,这件事在 10 个站里发生了 7 次——文档页交付给爬虫的可读正文比营销首页还少。linear.app 的文档页返回 1,264 字符,首页 9,526:那个用来解释产品的页面,给爬虫的东西只有卖产品那一页的八分之一。
怎么测的
每站两次请求,不渲染、不重试。取首页和最显眼的那个文档或帮助入口,去掉 <script> 与 <style>,剥标签,压空白,数字符。
文档入口不是完美的对照——有些是文档区的落地页而不是文章页。但那本身是结论的一部分,不是缺陷:一个什么都不交付的文档落地页,仍然是一个什么都不交付的文档落地页。
你的文档页比首页还空:逐站数字
按比值从高到低排。低于 1.0 的,就是文档交付得比营销页还少。
| 网站 | 首页 | 文档页 | 比值 |
|---|---|---|---|
| stripe.com | 7,342 | 21,369 | 2.9× |
| notion.com | 2,594 | 3,601 | 1.4× |
| nextjs.org | 7,110 | 7,817 | 1.1× |
| canva.com | 342 | 342 | 1.0× |
| figma.com | 3,932 | 3,640 | 0.9× |
| railway.com | 7,301 | 4,731 | 0.6× |
| supabase.com | 8,555 | 3,416 | 0.4× |
| framer.com | 12,708 | 4,709 | 0.4× |
| webflow.com | 25,082 | 4,204 | 0.2× |
| linear.app | 9,526 | 1,264 | 0.1× |
为什么这是反过来的
营销首页是公司重做得最频繁、最在意加载表现的那一页。而文档常常是一个应用:一个侧边栏、一个搜索框,内容在外壳之后才到。
但文档恰恰是答案引擎最想要的内容。一个人问「这个东西怎么配置」,问的就是文档问题。文档是空壳、首页不是,爬虫最后拿到的就是你的定位口号,一条答案都没有。
做对了的那一个
stripe.com 是往好的方向偏的异常值:文档侧 21,369 字符,首页 7,342,几乎三倍。文档是被服务端发出来的、而不是在浏览器里拼出来的,看起来就是这样。
要说明的是我们量的是交付,不是质量。一个页面可以交付两万字符的导航,照样没用。这份测量确立的是下限:低到几百字符,就连「没用」的资格都没有。
两头都空的那一个
canva.com 首页返回 342 字符,帮助页也是 342。完全一样,几乎可以肯定两边发的是同一个外壳,而且脚本跑起来之前里面没有内容。
我们没有再往下查,而且每个网址一次请求也不足以断言它一直如此。
这份测量说明不了什么
10 个站、每个网址一次请求、只测首页和一个文档入口、一台机器、一天。它没测更深的文章页是不是和入口一样,没测 Google 延后的渲染那一轮会不会最终把内容捞起来,也没测这些事有没有影响过任何一次引用。
它还分不出「文档是前端渲染的」和「这个网址本来就是个没什么字的落地页」。两者给出同一个数字,而我们没有逐个打开去区分。这是这份样本最大的弱点。
常见问题
你们是怎么测的
每个网址一条 curl,UA 用 OAI-SearchBot,剥脚本与样式,去标签,数字符。逐步的版本、包括怎么一次测自己三个网址,在AI 爬虫会执行 JavaScript 吗里。
这是不是说明这些站有 SEO 问题
对 Google 不一定,它会在单独的、更晚的一轮里渲染。它说明的是:对不渲染的客户端来说内容不存在,而喂 AI 答案的爬虫多数在这一类里。
为什么拿首页当基准,不设一个绝对阈值
因为没有有意义的绝对阈值——页面本来就该长短不一。首页是站内对照组:同一套技术栈、同一家公司、同一天。
一个数
10 个站里 7 个,文档页交付给爬虫的可读正文比营销首页还少。如果你只测过首页,那你测的恰好是最不可能出问题的那一页。修掉它、发出去、再推送收录,才是改变答案的那一步。



