Cloudflare AI Crawl Control:你可能早就有的逐爬虫可见性

它告诉你哪些 AI 服务抓过你的页面,并逐个放行或拦截。所有套餐都有、零配置——而多数站长从没打开看过。

抓取与收录3 分钟读完2014 次阅读
Cloudflare AI Crawl Control:你可能早就有的逐爬虫可见性

规则变动 · 2026-08-15 · Cloudflare 官方文档

Cloudflare AI Crawl Control 是一个看板:它告诉你哪些 AI 服务抓过你的页面,并让你逐个放行或拦截,而且所有套餐都有、零配置。这个组合比功能清单本身更要紧:如果你的站在 Cloudflare 后面,你其实已经有了逐爬虫的可见性——而多数站长以为那需要一份自己根本拿不到的服务器日志。

Cloudflare AI Crawl Control 做什么,用它自己的话说

四项能力,引自 2026 年 8 月 15 日读到的产品文档。

能力文档原文
可见性"See which AI services access your content"(看到哪些 AI 服务访问了你的内容)
控制"Control access with granular policies"——逐个爬虫放行或拦截
分析"Analyze AI traffic",理解爬虫的交互模式
合规"Monitor robots.txt compliance" 和 "Track which crawlers follow your directives"(跟踪哪些爬虫遵守了你的指令)

可用范围写得很直白:"Available on all plans",而且 "Deploy[s] with zero configuration"。

最有意思的是那条合规监控

robots.txt 里的一切都是请求。一个爬虫认不认,在此之前对任何拿不到服务器日志的人来说都是不可观测的——而多数跑在托管平台上的人,从来没见过那些日志。

一个能跟踪「哪些爬虫遵守了你的指令」的功能,堵的正是这个缺口。它是「我们请他们别来」和「我们知道他们来没来」之间的区别,而这个区别贯穿我们手册的每一章。

按次付费是真的,但现在用不了

文档里列了一个变现选项,可以 "Allow AI crawlers to access content by paying per crawl"(让 AI 爬虫付费换取抓取权限)。它的状态写着 "private beta"。

提它是因为它会被人当成已经上线的东西拿来跟你讲。它今天开不了,而一个依赖它的计划,是一个依赖别人内测功能的计划。

这不意味着什么

Cloudflare AI Crawl Control 可用,不等于它是一次对整个互联网的测量,也不告诉你那些在别处就被拦下、根本没到 Cloudflare 的爬虫的任何情况。它看到的是到达 Cloudflare 边缘的流量,那是一个很大但很具体的窗口,不是一个全景。

我们也没有在一个有真实 AI 爬虫流量的站上用过它,所以说不清打开之后数据到底有多细。上面所有内容都是文档说的,不是我们观察到的。

它在你整套配置里的位置

它不替代任何东西。它在边缘做观察和强制,那和你写的那些文件是不同的层。

是什么
robots.txt一个请求。爬虫自己决定认不认。
内容信号关于用途的声明,不管访问。
这一类边缘控制强制。请求要么完成,要么不完成。

出问题时这个顺序很要紧:一个爬虫拿到 403,是被第三行挡的,改第一行改多少次都没用。

常见问题

你们是怎么核实的

2026 年 8 月 15 日读 Cloudflare 的 AI Crawl Control 文档,把能力描述、可用范围和内测状态直接引出来。我们没有实际使用这个产品。

我不在 Cloudflare 上,等价物是什么

服务器日志,前提是你拿得到。两边的底层数据源都是它,产品只是它上面的一个视图。托管商完全不给你日志权限,那你就没有等价物——而这件事本身值得在挑托管之前就知道。

用了它,我的 robots.txt 要改吗

不用。它们是两层,而且两层都值得做对。该点哪些爬虫的名、以及对它们说什么,在robots.txt 怎么写才管得住 AI 爬虫

是不是该在边缘挡,而不是在 robots.txt 里挡

只有你真是这个意思的时候。边缘拦截是强制,所以它同样会挡住那些本来会老实遵守你礼貌请求的爬虫——包括把你放进答案里的那几个。

一句话

你要是在 Cloudflare 后面,逐爬虫的可见性已经开着,而多数站长从没打开看过。先去看、再决定、然后把改动推送收录,比在一个没人强制执行的文件里再加一行更值得当第一步。

Cloudflare AI Crawl Control:你可能早就有的逐爬虫可见性