RSS 订阅还剩多少:26 个首页 14 个有源,只有 7 个说了在哪

RSS 订阅没死,只是藏起来了。2026-08-20 抓的 26 个首页里 14 个还在维护一份能用的源,把地址写进 head 的只有 7 个,最新鲜的那一份恰恰没声明。

改写与发布4 分钟读完2674 次阅读
RSS 订阅还剩多少:26 个首页 14 个有源,只有 7 个说了在哪

实测 · 2026-08-20 · 30 个网站 · 一次抓取加 11 条路径猜测

样本与口径:自 2026-08-15 起一直在用的那 30 个站。2026-08-20 每个首页抓一次,浏览器 UA,解析 head 里的 <link rel="alternate">,把发现的源逐个拉下来解析。对一条都没声明的站,再按固定顺序试 11 条常规路径。

RSS 订阅在这批站上没死,只是藏起来了。26 个可读首页里有 14 个还在维护一份能用的源,而在首页 head 里把地址写出来的只有 7 个。剩下那 7 个,你得先知道地址才找得到。

怎么测的

两遍,规则都在跑数前写死。

  1. 解析首页 head 里媒体类型是 RSS 或 Atom 的 <link rel="alternate">,取第一条声明拉下来,数它的 <item><entry>
  2. 对一条都没声明的站,按顺序试 11 条路径:/feed/feed//rss/rss.xml/feed.xml/atom.xml/index.xml/blog/rss.xml/blog/feed/blog/feed.xml/blog/rss,命中第一个「200 + 可解析 XML + 至少一条」就停。

照例排除四个:stackoverflow.commedium.com 返回 403,www.canva.comwww.reddit.com 返回 200 但给的是挑战页和空壳。剩下 26 个首页的 head 是真读到了的。

声明了的有 7 个,7 个全部能打开

声明这件事很少见,但一旦声明就靠谱。每一条写在首页 head 里的源都一次拉通:200、合法 XML、有条目。

站点条目最新一条
www.nytimes.com262026-08-20 04:41 UTC
www.theverge.com102026-08-19 23:52
techcrunch.com202026-08-19 23:32
www.wired.com502026-08-19 23:00
news.ycombinator.com302026-08-19 17:32
www.netlify.com302026-08-19 16:51
developer.mozilla.org712026-06-15

Netlify 一口气声明了三条 —— 博客、更新日志、知识库,是面板里唯一一个把 head 当目录用的站。

MDN 那一条要多看两眼。声明了,格式合法,而我们读到它的那天,最新一条已经是 66 天前的。声明一份源和维护一份源是两回事,定时来拉这个地址的程序,分不出「没发新东西」和「这个文件没人管了」。

另外 7 个有源,但一个字都没提

19 个没声明的站里,7 个在前几条路径就被猜中了。

站点路径条目最新
arstechnica.com/feed202026-08-20 00:18
webflow.com/blog/rss.xml1002026-08-19 13:29
vercel.com/blog/rss.xml1,4862026-08-19
nextjs.org/feed.xml722026-08-18 16:00
supabase.com/rss.xml4202026-08-18
slack.com/blog/rss202026-08-07
discord.com/blog/rss.xml1002026-07-14

Ars Technica 是整次抓取里最扎眼的一个。它的源在我们读到时只有 8 小时新,比 7 条已声明的源里的 5 条都新,而它的首页对此只字不提。这批数据里最新鲜的那个文件,只有靠手敲 /feed 撞上才拿得到。

Vercel 的那份最大:一个文件里 1,486 条,装的是整个存档而不是最近一批。它和 Netlify 那份 30 条的文件是两种东西,名字却都叫 feed。

一份没人找得到的源,等于一份忘了声明的 sitemap。

做 RSS 订阅这件事,实际换来的是什么

有据可查的用处不在读者那边,在于 Google 认它是一种 sitemap 格式。sitemap 文档原文,2026-08-20 访问于 developers.google.com:「RSS, mRSS, and Atom 1.0 sitemaps are similar in structure to XML sitemaps, however they are often the easiest to provide because CMSes automatically create them.」

同一页也把代价写在了旁边:源只覆盖最近的条目,所以它是对完整 sitemap 的补充,不是替代。这正好是这批文件的形态 —— 10 到 100 条的滚动窗口,有东西上线就刷新一次。

26 个里有 12 个在 11 条路径上全部落空:stripe、linear、notion、figma、railway、framer、shopify、cloudflare、github、substack、bbc、wikipedia。其中好几家天天在发内容。它们只是把「怎么被发现」这件事整个交给了 sitemap 和自己的分发渠道。

这次测量回答不了什么

11 条路径是猜测清单,不是证明。一个站完全可以把源放在 /blog/atom 或者某个子域名上,于是被错误地记进「没有源」那一列。这份数据里的「没有」,只等于「那天在这 11 条路径上没有」。

我们没有测过任何 AI 引擎或搜索爬虫读不读这些源。Google 文档写了接受它当 sitemap,至于答案引擎拿一个源地址做什么,这次测量碰都没碰到。

还有一处分不开:安静的作者和废弃的文件。MDN 最新一条停在 2026-06-15,可能是 66 天没发,也可能是 66 天没人管。拉一次是分不出来的。

自己的源该查哪三件事

五分钟能做完。

  • 用无痕窗口打开自己的源地址,确认返回 200 且是可解析的 XML。这批 7 条已声明的源全过了,这是容易的那一半。
  • <link rel="alternate" type="application/rss+xml" href="…"> 写进它所描述的那一页的 head。这里一半能用的源,就是因为缺这一行而隐身。
  • 别声明一份已经不再更新的源。最新一条停在 66 天前也是一种信号,只是不是你想发出去的那种。

另一条发现线 —— robots.txt 里的 Sitemap: 那一行 —— 量在robots.txt 里的 sitemap 那一行;那些文件里的日期值多少,量在sitemap lastmod 值多少。想让引擎现在就知道有改动、而不是等下次抓取,走主动那条路:indexnow 怎么用。让这三条线指向同一批地址,是 QueryWin 正在做的事。

常见问题

你们是怎么测的?

2026-08-20 每个站抓一次首页,解析 head 里的源自动发现链接,把发现的源逐个拉下来解析。一条都没声明的站,按固定顺序试 11 条常规路径,命中第一个就停。

现在还有人用 RSS 订阅吗?

这批 26 个站里 14 个还在维护一份源,其中 6 个在抓取前 24 小时内发过新内容。至于人还订不订,是另一个问题,这次测量说明不了。

源能不能替掉 sitemap?

Google 接受 RSS 与 Atom 作为 sitemap 格式,但同时写明源装的是最近的条目,两者干的活不一样。源管新鲜度,sitemap 管覆盖面。

那一行链接该写在哪儿?

写在这份源所描述的那一页的 head 里,并带上明确的媒体类型。Netlify 在那里放了三条、各带标题,是面板里最清楚的一种写法。