最新在前 · 支持 RSS
实测与动态
AI 引擎和平台的规则变动、线上网站的实测记录,以及产品发布。
抓取与收录给 AI 爬虫提供 markdown:6 个文档站里 3 个已经做了
Anthropic、Next.js、Cloudflare 在网址后加 .md 都会返回 text/markdown。有一个站从 .md 返回 HTML 却报 200——看 content-type,别看状态码。
抓取与收录Cloudflare AI Crawl Control:你可能早就有的逐爬虫可见性
它告诉你哪些 AI 服务抓过你的页面,并逐个放行或拦截。所有套餐都有、零配置——而多数站长从没打开看过。
抓取与收录点名一个爬虫通常就等于挡掉它:99 个分组里 82 个
14 个站的 99 个点名分组里,82 个是整站禁止。但有三个站点了名一个都没挡——只数点名数,等于把两个相反的决定混成一个数字。
抓取与收录robots.txt 里的内容信号:34 个站里 7 个写了
内容信号声明的是「抓走之后能做什么」。Cloudflare 2025 年 9 月推出并自动给 380 万域名加上,我们在 34 个知名站里找到 7 个。
抓取与收录多数首页根本没有结构化数据:14 个里 9 个
以 AI 爬虫身份抓了 14 个知名首页,9 个交付了零个 JSON-LD 块。这条线比铺天盖地的 schema 教程暗示的低得多。
抓取与收录GPTBot 和 OAI-SearchBot 的区别:挡错那个代价最大
挡掉 GPTBot 不会让你从 ChatGPT 消失,管那件事的是 OAI-SearchBot。每家 AI 公司现在都跑好几个爬虫,这是逐个核过官方文档的地图。
抓取与收录你的文档页比首页还空:10 个站里 7 个
10 个知名站实测:7 个的文档页交付给 AI 爬虫的可读正文比营销首页还少。linear.app 的文档只有首页的八分之一。
抓取与收录根本没有 noai 指令:管 AI 引用多少的是 nosnippet
没有 noai 这个指令。Google 文档写明 max-snippet 适用于 AI Overviews 和 AI Mode——真正管 AI 界面能引用你多少的是它,不是 robots.txt 里的任何东西。
抓取与收录谁在挡 AI 爬虫、谁在发 llms.txt:30 个站,两种相反的策略
30 个知名站的 robots.txt 与 llms.txt 实测:新闻出版类成打点名 AI 爬虫、一个 llms.txt 都不发;开发工具类正好相反。
抓取与收录AI 爬虫从前端渲染的网站上拿到了什么:342 到 25,082 字符
AI 爬虫从前端渲染的网站上拿到了什么?15 个知名站首页实测:14 个返回 200,可读正文从 342 到 25,082 字符,相差 73 倍。
抓取与收录结构化数据怎么加:哪几种还活着,哪两种已经下线
结构化数据怎么加?HowTo 与 FAQPage 在 Google 已双双下线。这里是仍受支持的类型、四段可粘的 JSON-LD,以及会招致人工处罚的那条规矩。
抓取与收录llms.txt 怎么写:模板、谁在发、以及它做不到什么
llms.txt 怎么写?把最值得看的页面列出来、每条配一句说明。附格式、可填模板、30 个站的采用情况,以及它做不到的五件事。
