AI 爬虫从前端渲染的网站上拿到了什么:342 到 25,082 字符
AI 爬虫从前端渲染的网站上拿到了什么?15 个知名站首页实测:14 个返回 200,可读正文从 342 到 25,082 字符,相差 73 倍。

实测 · 2026-08-15 · 15 个网站 · 单次快照
样本与口径:15 个知名公网站点,每站首页请求一次,UA 用 OAI-SearchBot,2026 年 8 月 15 日从同一台机器发出。剥掉 script 与 style 之后,按字符数计可读正文。
AI 爬虫从前端渲染的网站上拿到了什么,站与站之间相差 73 倍。15 个里 14 个返回 200,而这些 200 里的可读正文,从 342 字符到 25,082 字符——这些站在浏览器里看都是完整的。剩下一个 airbnb.com 返回 403,什么都没给。状态码几乎什么都没告诉我们,字符数告诉了我们全部。
怎么测的
每个首页一次请求,不渲染、不重试。剥掉 <script> 和 <style> 块,去掉剩余标签,压掉空白,数字符。同时记录交付的 HTML 里有没有 h1、有没有 JSON-LD 块。
这是故意做得最糙的一种测量。它正好等于一个不执行 JavaScript 的爬虫收到的东西,而这就是重点。
AI 爬虫从前端渲染的网站上拿到了什么:逐站结果
按可读正文从多到少排。原始字节那一列放在这儿,是为了让你看清这两个数几乎没关系。
| 网站 | 原始字节 | 可读正文 | h1 |
|---|---|---|---|
| webflow.com | 624,176 | 25,082 | 2 |
| framer.com | 2,150,677 | 12,708 | 1 |
| linear.app | 1,263,291 | 9,526 | 1 |
| supabase.com | 1,326,876 | 8,555 | 1 |
| slack.com | 250,889 | 8,286 | 1 |
| stripe.com | 658,126 | 7,342 | 2 |
| railway.com | 461,551 | 7,301 | 1 |
| nextjs.org | 315,975 | 7,110 | 1 |
| developer.mozilla.org | 121,316 | 6,723 | 1 |
| discord.com | 169,856 | 4,550 | 1 |
| figma.com | 1,675,088 | 3,932 | 1 |
| vercel.com | 3,012 | 2,980 | 0 |
| notion.com | 218,688 | 2,594 | 1 |
| canva.com | 8,008 | 342 | 1 |
| airbnb.com | 403 — 被拒 | ||
字节数不等于内容
按体积排的顺序和按可读正文排的顺序几乎不相干。framer.com 发了 2,150,677 字节,换来 12,708 字符正文——大约千分之六。developer.mozilla.org 发了 121,316 字节,少十七倍,换来 6,723 字符,只少一半。
一个爬虫下载两兆去找一万两千个字符,是在为很少的东西做很多功。而响应里没有任何东西会提示这件事。
两个异常值才是有意思的部分
canva.com 返回 8,008 字节,其中可读正文 342 字符。对一个不跑脚本的客户端来说,这一页基本是空白的。而任何人用浏览器打开,看到的是一个完整的营销首页。
vercel.com 更奇怪,我们不打算假装知道发生了什么。它返回 3,012 字节,其中 2,980 是文字——98% 的文字占比,全组最高——并且完全没有 h1。这种组合通常意味着这个 UA 拿到的不是常规首页。我们没有追下去,而且单次请求也不足以对它下任何结论。
有一个站直接拒了
airbnb.com 返回 403。15 次请求里 1 次被拒,这件事值得明说,因为同一天我们另外测过 11 个知名站点,每一个都返回 200。边缘拦截是真实存在的,但在这个样本里并不常见。
为什么被拒,我们说不了。403 不会解释自己,而且我们没有换地址测过,所以分不出这是一条按 UA 匹配的规则,还是按地址匹配的规则。
这份测量说明不了什么
每站一次请求、一台机器、一天、只测首页。它没有测任何引擎实际有没有引用这些站,没有测内页是不是和首页一样,也没有测一个真爬虫从它自己的地址来会拿到什么。而且首页是多数网站上最不具代表性的一页——它通常是最手工的那一页。
它只量了一件事:那一次,回来了什么。其余全部是从这件事上做的推断。
常见问题
你们是怎么测的
每站一条 curl,UA 用 OAI-SearchBot,剥掉 script 和 style,去标签,数字符。方法在AI 爬虫会执行 JavaScript 吗那一章里逐步写清了,你可以拿去测自己的站再来对照。
字符数低就说明有 SEO 问题吗
不一定,尤其对 Google 不一定——它会在延后的第二轮里渲染 JavaScript。它说明的是:对那些不渲染的客户端来说内容不存在,而喂 AI 答案的爬虫多数属于这一类。
为什么只测首页不测文章页
因为首页是这些彼此毫无共同点的公司之间唯一可比的东西。这也是这份样本最大的局限,做一版内页的测量是明摆着的下一步。
一句话
14 个站全部返回 200、在浏览器里全部完整、交付的可读正文却在 342 到 25,082 字符之间。你要是从没查过自己的站落在这个区间的哪一端,那个状态码一直什么都没告诉你。把修法做完、发出去、再推送收录,才是真正改变答案的那一步。



