AI 爬虫从前端渲染的网站上拿到了什么:342 到 25,082 字符

AI 爬虫从前端渲染的网站上拿到了什么?15 个知名站首页实测:14 个返回 200,可读正文从 342 到 25,082 字符,相差 73 倍。

抓取与收录3 分钟读完1918 次阅读
AI 爬虫从前端渲染的网站上拿到了什么:342 到 25,082 字符

实测 · 2026-08-15 · 15 个网站 · 单次快照

样本与口径:15 个知名公网站点,每站首页请求一次,UA 用 OAI-SearchBot,2026 年 8 月 15 日从同一台机器发出。剥掉 script 与 style 之后,按字符数计可读正文。

AI 爬虫从前端渲染的网站上拿到了什么,站与站之间相差 73 倍。15 个里 14 个返回 200,而这些 200 里的可读正文,从 342 字符到 25,082 字符——这些站在浏览器里看都是完整的。剩下一个 airbnb.com 返回 403,什么都没给。状态码几乎什么都没告诉我们,字符数告诉了我们全部。

怎么测的

每个首页一次请求,不渲染、不重试。剥掉 <script><style> 块,去掉剩余标签,压掉空白,数字符。同时记录交付的 HTML 里有没有 h1、有没有 JSON-LD 块。

这是故意做得最糙的一种测量。它正好等于一个不执行 JavaScript 的爬虫收到的东西,而这就是重点。

AI 爬虫从前端渲染的网站上拿到了什么:逐站结果

按可读正文从多到少排。原始字节那一列放在这儿,是为了让你看清这两个数几乎没关系。

网站原始字节可读正文h1
webflow.com624,17625,0822
framer.com2,150,67712,7081
linear.app1,263,2919,5261
supabase.com1,326,8768,5551
slack.com250,8898,2861
stripe.com658,1267,3422
railway.com461,5517,3011
nextjs.org315,9757,1101
developer.mozilla.org121,3166,7231
discord.com169,8564,5501
figma.com1,675,0883,9321
vercel.com3,0122,9800
notion.com218,6882,5941
canva.com8,0083421
airbnb.com403 — 被拒

字节数不等于内容

按体积排的顺序和按可读正文排的顺序几乎不相干。framer.com 发了 2,150,677 字节,换来 12,708 字符正文——大约千分之六。developer.mozilla.org 发了 121,316 字节,少十七倍,换来 6,723 字符,只少一半。

一个爬虫下载两兆去找一万两千个字符,是在为很少的东西做很多功。而响应里没有任何东西会提示这件事。

两个异常值才是有意思的部分

canva.com 返回 8,008 字节,其中可读正文 342 字符。对一个不跑脚本的客户端来说,这一页基本是空白的。而任何人用浏览器打开,看到的是一个完整的营销首页。

vercel.com 更奇怪,我们不打算假装知道发生了什么。它返回 3,012 字节,其中 2,980 是文字——98% 的文字占比,全组最高——并且完全没有 h1。这种组合通常意味着这个 UA 拿到的不是常规首页。我们没有追下去,而且单次请求也不足以对它下任何结论。

有一个站直接拒了

airbnb.com 返回 403。15 次请求里 1 次被拒,这件事值得明说,因为同一天我们另外测过 11 个知名站点,每一个都返回 200。边缘拦截是真实存在的,但在这个样本里并不常见。

为什么被拒,我们说不了。403 不会解释自己,而且我们没有换地址测过,所以分不出这是一条按 UA 匹配的规则,还是按地址匹配的规则。

这份测量说明不了什么

每站一次请求、一台机器、一天、只测首页。它没有测任何引擎实际有没有引用这些站,没有测内页是不是和首页一样,也没有测一个真爬虫从它自己的地址来会拿到什么。而且首页是多数网站上最不具代表性的一页——它通常是最手工的那一页。

它只量了一件事:那一次,回来了什么。其余全部是从这件事上做的推断。

常见问题

你们是怎么测的

每站一条 curl,UA 用 OAI-SearchBot,剥掉 script 和 style,去标签,数字符。方法在AI 爬虫会执行 JavaScript 吗那一章里逐步写清了,你可以拿去测自己的站再来对照。

字符数低就说明有 SEO 问题吗

不一定,尤其对 Google 不一定——它会在延后的第二轮里渲染 JavaScript。它说明的是:对那些不渲染的客户端来说内容不存在,而喂 AI 答案的爬虫多数属于这一类。

为什么只测首页不测文章页

因为首页是这些彼此毫无共同点的公司之间唯一可比的东西。这也是这份样本最大的局限,做一版内页的测量是明摆着的下一步。

一句话

14 个站全部返回 200、在浏览器里全部完整、交付的可读正文却在 342 到 25,082 字符之间。你要是从没查过自己的站落在这个区间的哪一端,那个状态码一直什么都没告诉你。把修法做完、发出去、再推送收录,才是真正改变答案的那一步。

AI 爬虫从前端渲染的网站上拿到了什么:342 到 25,082 字符