nofollow 实测:5,104 条链接里只有 61 条带,sponsored 全样本一条
nofollow 比围绕它的说法罕见得多:27 个首页 5,104 条链接里只有 61 条带,19 个站一条都没用,整批样本 rel=sponsored 和 rel=ugc 各只有一条。

实测 · 2026-08-23 · 27 个首页 · 单次抓取 · 解析链接
样本 / 口径:2026-08-15 以来一直在用的那批 30 个站,2026-08-23 当天每个首页抓一次,浏览器 UA。解析返回 HTML 里的每一个 <a>,把 href 按最终地址还原成绝对路径,记下 rel 和 target,以及这条链接有没有可见文字。
27 个首页一共 5,104 条链接,其中带 nofollow 的只有 61 条 —— 占全部链接的 1.2%,占 963 条外链的 6.3%。19 个站一条都没用。Google 用来替代通用 nofollow 的那两个属性更罕见:整批样本里 sponsored 一条,ugc 一条。
怎么测的
每站一次 HTTP 请求,不渲染、不重试。纳入规则跑数前就写死:状态 200、响应体不小于 10,000 字节、含 <body。30 个里有 3 个没过 —— stackoverflow.com 和 medium.com 返回 403,www.reddit.com 返回 200 但只有 8,393 字节的空壳 —— 剩下 27 个,与前三批被剔的是同样三个站。
一条链接算数的条件:是带 href 的 <a>,href 非空,且不以 #、javascript:、mailto:、tel: 开头。站内的判定是「解析后的主机 == 跟随重定向后的最终主机」,所以 www.shopify.com 指向自家子域在这里算外链。这是我们的测量口径,不是在声称 Google 也这么算。
哪些站真的在用 nofollow
8 个。名单短到可以整个印出来,而它的构成比总数更有意思:媒体站都在上面,软件公司几乎一个都没有。
| 站点 | nofollow | 其中外链 | 外链总数 |
|---|---|---|---|
| www.theverge.com | 35 | 26 | 53 |
| techcrunch.com | 8 | 8 | 9 |
| www.shopify.com | 7 | 7 | 44 |
| www.wired.com | 5 | 5 | 18 |
| news.ycombinator.com | 3 | 2 | 33 |
| railway.com | 1 | 1 | 16 |
| substack.com | 1 | 1 | 3 |
| www.nytimes.com | 1 | 0 | 13 |
8 个里有 4 个是新闻或出版站 —— 付费位和转载链接本来就发生在那儿。TechCrunch 给 9 条外链里的 8 条打了标,比例是全样本第一。纽约时报那一行是个例外:它唯一那条 nofollow 挂在内链上,而这正是 Google 文档不建议的用法,站内要挡它点名的是 robots.txt 的 disallow 规则。
27 个站里有 20 个,外链一个标都不打。这是默认状态,不是疏忽。
sponsored 和 ugc 基本没人用
Google 推出 rel="sponsored" 和 rel="ugc",是想用更精确的标记替掉一刀切的 nofollow,文档至今仍写着付费链接「sponsored is preferred」。5,104 条链接里我们各找到一条:www.theverge.com 上一条 sponsored,substack.com 上一条 ugc。
这不等于这两个属性没用。它说明首页本来就不是它们该出现的地方 —— 付费位在文章页,用户内容在评论区,都不在首页。这批样本能说明的是另一件事:Google 建议的那次迁移,还没走到这些站的大门口。
5,104 条链接排开是什么样
每个首页的链接数从 21 到 395,中位 165。内链 4,141 条,占 81%。
| 指标 | 条数 | 占比 |
|---|---|---|
| 全部链接 | 5,104 | 100% |
| 站内 | 4,141 | 81.1% |
| 站外 | 963 | 18.9% |
| rel=nofollow | 61 | 1.2% |
| target=_blank | 357 | 7.0% |
| 空锚文本 | 311 | 6.1% |
| rel=sponsored | 1 | 0.02% |
| rel=ugc | 1 | 0.02% |
有一个站把内外链的比例整个搅乱了。www.wikipedia.org 是语言门户,374 条链接全是外链,触及 361 个不同主机 —— 每个语种是一个子域。把它剔掉,全样本外链占比从 18.9% 掉到 11% 左右。谁要引用 18.9% 这个数,先知道这件事。
311 条没有字可读的链接
这批链接里有 6% 没有可见文字。它们是图标、logo 和纯图片方块,而 Google 文档写得很明确:图片链接它拿 alt 当锚文本。所以一条空链接里再套一张空 alt 的图,爬虫拿到的就只有一个目的地,没有任何关于它的描述。
分布很不均匀。arstechnica.com 一家就占了 311 条里的 67 条,接着是 stripe.com 和 news.ycombinator.com 各 31 条。这些链接里的图有没有 alt,我们这次没测,所以说不出有多少条是真的没描述。这是本次抓取本该收、却漏掉的一个数。
这对你的站意味着什么
这批数据的实际读法是:链接标记是个小范围的活儿,不是全站策略。跟着来的有四条。
- 普通外链别动。Google 文档说,你希望它正常抓取解析的链接不需要加任何 rel。
- 付费位用
sponsored,评论和论坛链接用ugc。首页上几乎没人这么做,所以在该做的地方做了也不会显得奇怪。 - 别拿 nofollow 在自己站内雕抓取。Google 为这件事点名的是 robots.txt,我们找到的那条站内 nofollow 是个例外不是范式。
- 别发 alt 为空的图片链接。那等于发了一条没有文字的链接。
想要方法而不是数字,同一件事的 hub–spoke 做法写在 网站结构与内链 那一篇里,附一张记录谁链向谁的审计表。想先确认爬虫能不能读到这些页面,AI 爬虫可达性检查 一次请求就能答。
常见问题
你们是怎么测的
2026-08-23 每站一次首页请求,桌面浏览器 UA,跟随重定向,不执行 JavaScript。链接只从返回的 HTML 里解析,所以前端框架在运行时插进去的链接不在这些计数里。
nofollow 链接还传不传权重
Google 文档说带这些属性的链接「will generally not be followed」,另外说被链页面可能通过其它途径仍被抓到。它没有描述一种「传一部分」的机制,我们也没测。
首页放 165 条链接算多吗
Google 没发过上限,这批样本也给不出一个。这个数是导航密度的设计选择,不是合规指标。我们量的是现状,说不出这些站少放几条能得到什么。
为什么把锚点和 javascript 链接排除掉
因为它们不指向另一个页面。# 是页内导航,javascript: 那种写法正是 Google 文档列在「不推荐」里的,算进来只会把每个站的总数撑大,不会多出任何一条路。


