crawl budget 到底归不归你管:Google 自己给了两条门槛
crawl budget 真的存在,而 Google 说绝大多数站不该操心它。两条规模门槛加一个 Search Console 状态决定它归不归你管,本章给四步自查和按成本重排的修法清单。

crawl budget 是真的存在,而 Google 自己的文档说绝大多数站不该操心它。够得着的条件一共三条:两条按规模,一条按症状。三条都不沾,文档给的处置很直接 —— 把网站地图保持更新,定期看 Page Indexing 报告,然后去干别的。这一章教你判自己在哪一边。
读这篇前
你需要知道一个主机名下大概有多少个不重复网址、这些页面多久变一次,以及有这个站的 Search Console 权限。用不上服务器日志,有当然更好。如果你的站不到一万个页面、发出来一两天内就被抓走,读完下一节就可以停了。
三条资格条件,和那句把其余人劝走的话
Google 的抓取预算文档,2026-08-26 读,开头第一段就把大部分读者排除在外:
"If your site doesn't have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don't need to read this guide."
接着它点名这份指南是给谁的。三条,其中一条根本不看规模。
| 条件 | 门槛 |
|---|---|
| 大站,变更中等 | 百万页以上,每周 |
| 中站,变更极快 | 一万页以上,每天 |
| 发现之后卡住 | 不限规模 |
第三条值得读两遍:「Sites with a large portion of their total URLs classified by Search Console as Discovered - currently not indexed.」这是一份你现在就能打开的报告,也是三条里唯一不看你有多大的一条。
开始数之前先确认一个定义。Google 把「站」定义成主机名:「https://www.example.com/ and https://code.example.com/ are treated as separate sites and have separate crawl budgets.」文档子域和博客子域不共用同一个池子,所以要按主机名数,不是按公司数。
这个预算由什么构成
两个部分,你能影响的程度差得很远。文档把它们拆成抓取容量上限和抓取需求,然后说清了两者不一致时算谁的:「Even if the crawl capacity limit isn't reached, if crawl demand is low, Google will crawl your site less.」
容量上限说的是你的服务器。所有站从同一个地方起步 ——「Every site starts with the same default, conservative crawl capacity limit」—— 之后按服务器的表现上下浮动。响应稳定、延迟不涨,上限往上走;变慢、返回 5xx、或者发出 HTTP 429 这种限流信号,上限往下掉。
需求说的是 Google 想不想要这些页面。文档列了三个因素:感知库存、热度、陈旧程度。第一个后面跟了一句另外两个没有的话:「This is the factor that you can positively control the most.」感知库存指的是 Google 认为你有的那一堆网址,包括你从没打算发布的重复页和参数变体。
crawl budget 不是发给你的配额。它是「你的服务器扛得住多少」和「Google 想抓多少」的重叠部分。
容量那一侧有一个自己给自己挖的坑,出海站尤其容易踩:在 CDN 或防火墙上开了激进的限流规则,然后对 Googlebot 也返回 429。文档把这个状态归进了服务器错误那一档,上限会跟着往下掉。换句话说,你可能一边在担心抓得不够,一边在亲手告诉对方少抓一点。这一条查起来不难,服务器日志里按状态码筛一遍就能看见。
四步判断 crawl budget 归不归你管
四个检查,用的都是你手上已经有的东西。按顺序跑,第一个跑出干净结果就可以停 —— 一个明确的否定就足够把这个问题关掉。
- 数一个主机名下的不重复网址。网站地图里的条数是最快的估算;如果地图条数比 Search Console 里的网址数少很多,这个差本身就是发现
- 问一句:这些页面里正常一周会变多少个。一万个页面的商品库一年改两次,按这份文档的定义不算变更快的站
- 打开 Page Indexing 报告,看落在 Discovered - currently not indexed 里的占比。占比大就是第三条资格条件
- 发一篇东西,看多久被抓走。当天就出现的话,文档已经替你回答了
四步都没查出东西,就到此为止。文档给其余人的处置只有两句:把网站地图保持更新,定期看 Page Indexing 报告。
交付物:该修什么,按什么顺序
真的够着了条件,那份最佳实践清单就是工作量本身。值得按「你控制得了多少」重排一遍,因为原表把顺手就能做的和要重做一遍的混在了一起。
| 动作 | 修的是 | 成本 |
|---|---|---|
| 合并重复内容 | 感知库存 | 中 |
| 删掉的页返回 404 或 410 | 感知库存 | 低 |
| 清掉 soft 404 | 白抓 | 低 |
| 发 ETag 或 Last-Modified | 让 304 成为可能 | 低 |
| 缩短重定向链 | 白抓 | 中 |
| 网站地图保持更新 | 需求信号 | 低 |
| 屏蔽真正不重要的网址 | 感知库存 | 中 |
| 把服务器响应变快 | 容量上限 | 高 |
304 那一行是多数站在不知情的状态下没做的。Google 点名要它 ——「Support 304 (Not Modified) HTTP status codes. If a page hasn't changed since Google last crawled it, returning a 304 code tells Google to reuse the cached version」—— 而 304 需要你先发出一个校验器。本站测过27 个首页的 http 缓存头,其中 13 个既不发 ETag 也不发 Last-Modified,那么无论爬虫怎么问,这个响应都不可能发生。
查自家源站只要一行:
# 你到底发没发校验器
curl -sI -A 'Mozilla/5.0' https://example.com/ \
| grep -i -E 'etag|last-modified|cache-control'
什么都没返回,就是任何条件请求都不可能命中。这是一行配置,不是一次重做。
做出海站的两种常见误判
第一种是把多语言当成规模。一个五百页的站翻十二种语言,网址数变成六千,看着离一万只差一步。但门槛的第二条要求的是「每天变更」,翻译页跟着原文走、原文一年改两次,这个站离资格条件仍然很远。真正会因为多语言出问题的是另一件事:语种版本之间互相被判成重复,那属于感知库存,跟预算规模没关系。
第二种是把参数当成页面。带筛选和排序参数的商品列表能把几百个页面撑成几万个网址,而这正是文档点名的例子 ——「infinite scrolling pages that duplicate information on linked pages, or differently sorted versions of the same page」。这种站可能真的够着了第三条症状条件,但要修的不是预算,是让那几万个网址不再被当成几万个页面。
做错了会怎样
第一个错是拿 robots.txt 去缩感知库存。感觉像删掉了,其实不是。文档在讲删除页面时把区别说得很清楚:「Google won't forget a URL that it knows about, but a 404 status code is a strong signal not to crawl that URL again. Blocked URLs, however, will stay part of your crawl queue much longer, and will be recrawled when the block is removed.」屏蔽适用于「存在但不该被抓」的页面,对已经没了的页面它是错的工具。
第二个错是 soft 404,也是最贵的一种白抓,因为它看起来是成功的。一个返回 200 却写着错误信息的页面会按正常节奏被永远抓下去。Google 的指令是清掉它们,并去 Page Indexing 报告里找名单;本站测过不存在的地址在 27 个首页上返回了什么,这个毛病在真实站点上确实存在,而站长自己并不知道。
第三个错是把 crawl budget 当成增长杠杆。文档给的增长路径只有两条:容量是瓶颈就加服务器资源,以及针对目标产品提升内容质量。两条都不是开关。如果你的页面被抓了却没被收录,那从头到尾就不是容量的问题,答案在页面写了什么里面。
这一章管不到的地方
本篇判不了「crawl budget 是不是你的问题」,只能判「你符不符合 Google 给的那几条条件」,而对绝大多数站,诚实的答案是不符合。没有任何公开数字能告诉你「我有多少预算」,也没有哪份报告显示它 —— 这就是上面每一步都是检查而不是测量的原因。
它也不管这些动作要多久才看得见。抓取、收录、排名、被引用走的是四个不同的钟,只有一个有公开数字,见google 收录要多久那篇的四个阶段和「多久没动静该判定失败」。如果你真正想知道的是爬虫到底够不够得着你的页面,那是另一个检查:先看看爬虫从这个页面收到了什么,再去怀疑队列。
常见问题
crawl budget 会影响排名吗
不直接影响。它管的是你的站有多少被抓、抓得多勤。一个从没被抓过的页面确实排不上,所以在极端处有影响;但一个所有页面都在被抓的站,它已经解释不了任何事情了。
页面被抓了却没被收录,算预算问题吗
不算,而这个区别正是有用的地方。被抓了说明取回发生过,容量和需求都尽到了职责,接下来是收录决策,那不归这份文档管。唯一指回这里的状态是 Discovered - currently not indexed:网址已知,取回还没发生。
在 robots.txt 里屏蔽一批页面,能给剩下的腾出预算吗
对「存在且确实不重要」的页面可以,文档点名的例子是无限滚动的变体和换了排序的同一个列表。但它清不掉已经不存在的网址,因为被屏蔽的网址会留在队列里,等屏蔽一撤又回来。
怎么才能拿到更多 crawl budget
文档给的路径只有两条,而且都在标记之外。URL 检查工具报 Hostload exceeded 就加服务器资源;另一条是提升内容质量,Google 对 Search 的描述是热度、整体用户价值、内容独特性和服务能力。没有第三条。
子域和主站共用一份预算吗
不共用。Google 的抓取基础设施把每一个不重复的主机名当成独立的站,各有各的预算。文档子域被抓得慢,怪不到主站头上。
本文属于 QueryWin 实操手册 · 第 3 阶


