ai 搜索优化:被摘走的是一节,不是一整页
ai 搜索优化在排版这一层只答一个问题:能回答问题的那段文字从哪儿开始到哪儿结束。六条可核对的结构规则,外加一条中文独有的:把「铺垫」倒过来写。

ai 搜索优化在排版这一层只回答一个问题:一段能回答问题的文字,从哪儿开始,到哪儿结束。标题划出这个边界,每个标题下的第一句承载结论,三个变量以上的事实一律上表格。这一篇是那份模板,每条规则都给了能核对的数字。
读这篇前
结构是第二个问题。第一个是引擎能不能取到你的页面、交付的 HTML 里有没有文字——那是geo 优化的第一步,那一关不过的页面,本篇写的对它一条都不成立。
写什么也是另一个问题。哪些结论值得写、怎么措辞才经得起被单独摘走,在内容怎么写才会被 AI 引用里。本篇默认你已经知道这一页是干什么的。
被摘走的单位是一节,不是一整页
答案引擎不会引用你的文章,它引用的是一段文字,然后把出处标成你的网址。所以设计目标是:整页由一节节各自独立成立的文字组成,而不是一篇必须顺着读下来才成立的文章。
这带来一个跟中文写作训练直接冲突的结论:节与节之间的过渡句是废重量。「说完前一部分,我们接着来看」这种句子只在线性阅读里有用,而它占掉的正是一节里最该放结论的那一行。
🔴 中文写作最大的敌人是「铺垫」
这一节是中文读者独有的。中文议论文的训练是先交代背景、再层层递进、最后给结论——放在提取场景里,这个顺序正好是反的。一段用行业大势起头、结论落在第三段的文字,机器摘不走:它要么连铺垫一起摘(那句结论就被稀释了),要么什么都不摘。
改法不是把文章写短,是把每一节的顺序倒过来:结论先落地,条件和背景跟在后面。整篇文章的信息量一点不减,只是每一节都变成了可以单独拎出来的东西。
模板
六条规则。每一条都不用工具就能核对,所以它们写成的是数字,不是建议。
| 元素 | 规则 | 怎么核对 |
|---|---|---|
| h1 | 正好一个,说清这页是什么 | curl 取回来数 |
| 开篇段 | 40–80 字答完标题 | 数字数 |
| 每个 h2 | 是断言或问句,不是标签 | 抽出来单独读一遍 |
| h2 下第一句 | 就是答案,一句话 | 删掉后面的,看它还成不成立 |
| 表格 | 三个变量以上一律上表 | 数你本来要写进句子的列 |
| FAQ 问句 | 用真实搜索原话 | 拿去跑一遍下拉联想 |
把所有 h2 抽出来单独读一遍
把页面里每个 h2 按顺序抽成一个纯列表,别的什么都不留。如果这个列表读起来像整篇文章的摘要,结构就是对的;如果读起来像一份由名词组成的目录,就是错的。
这条之所以成立,是因为标题是提取方在决定「这一节相不相关」之前唯一能便宜读到的部分。一个只点出话题的标题让它去猜,一个直接给出断言的标题当场就把问题答了。
| 标签式标题 | 断言式标题 |
|---|---|
| 概述 | 为什么光靠 robots.txt 拦不住 AI 爬虫 |
| 实现方式 | 一条命令查完 14 个爬虫 |
| 总结 | 发现是 CDN 在挡的时候该怎么办 |
80 字这个数是怎么来的
每个标题下的头 40 到 80 字里把答案给完。下限的存在是因为比这更短的结论通常会漏掉自己的成立条件,被单独摘走之后就不再为真。上限的存在是因为比这更长的一段会开始依赖它上面那句话。
这是一条工作约定,不是测出来的阈值。我们没有测过被引率和段落长度的关系,所以就这么说,而不是把一条写作惯例包装成一个发现。能指出来的是它挡掉的那种失败:一节的第一句是背景、答案在第三段才出现,那么摘它就必须连铺垫一起摘。
三个变量以上就上表格
句子是装结构化事实的差容器。三个站、每个两项属性,写成句子就成了一段谁也从里面抽不出单独一行的文字;同样的内容做成表格,就给了引擎六个可寻址的格子。
经验判据:一旦你发现自己在写「A 是 X,而 B 是 Y,C 则是 Z」,停下来,做成三行。我们自己那些实测文就是照这个写的,而表格恰恰是被读得最多的部分。
FAQ 的问句必须是别人的话
按被打进搜索框的样子写,不是按开会时的说法写。「挡了 GPTBot,ChatGPT 就不会引用我了吗」是一个真实问句的形状;「关于爬虫管理的若干考量」根本不是问句。
每个准备用的问句,定稿前拿去跑一遍下拉联想。如果这个说法什么都不出、而一个更糙的版本出了,就用糙的那个——被真正打出来的是糙的那个。
结构救不了什么
这些都不能让一个内容单薄的页面变得值得引用。结构决定一个好结论能不能被找到并摘走,它对「这个结论值不值得摘」一句话都说不了。一个结构完美但没什么可断言的页面,是一个组织得很好的空。
它也扛不住渲染问题。我们抓的 27 个首页里有 6 个连 h1 都没有,其中一个只交付了 3 KB 的加载器——那一页上所有结构决定都要等 JavaScript 跑完才存在。那篇实测是h1 标签:27 个首页有 6 个一个都没有,在你花一天调标题层级之前值得先读它。
我们也无法告诉你照这么做被引率会上升。没有公开数据把段落结构和被选中挂起来,我们不会去编一个数字。这份模板做的是消掉那些能观察到的失败:摘不走的段落、寻不到址的事实、没人会问的问题。
做错了会怎样
下面三种都会产出一个作者看着没问题、机器读起来完全摘不走的页面——这是最糟的组合,因为没有任何信号提示你哪里不对。
- 标题最后才写,当成给已完成段落贴的标签。它描述的会是文字的形状,不是文字说了什么。
- 答案埋在铺垫底下。任何以「在看这个之前」开头的一节,都已经把自己的结论推出了可及范围。
- FAQ 是在工位上想出来的。没人会打的问句什么都匹配不上,而且那一块在人读起来也像凑数。
交付物:ai 搜索优化的五步结构自查
挑一个你在意的页面,按顺序跑。这份清单故意做得很机械,因为对着自己的稿子时,最先失灵的就是对结构的判断力。
- 用 curl 取回页面,数 h1 标签——答案必须是 1。
- 把所有 h2 抽成一个纯列表读一遍。不像摘要,就先改标题,别动别的。
- 逐节删掉第一句之后的所有内容,看那一句还答不答得了它自己的标题。
- 找出每一段含三个以上可比事实的文字,改成表格。
- 把每个 FAQ 问句跑一遍下拉联想,零结果的换掉。
第二步和第三步能抓出其中大部分。把这套自查在每一页上跑一遍、而不是只跑你想起来的那一页,正是 QueryWin 要做的事。
常见问题
一页该有几个 h2?
有几个结论就有几个。一页只有一个结论却挂了八个标题,那就是七个标题底下装着凑数的内容——抽出来当列表读一遍就看得很清楚。
标题顺序重要吗?
对人重要。对提取没那么重要,每一节是被独立寻址的。按人读的逻辑排,机器那一侧自然就够用了。
每页都要有 FAQ 吗?
只在真有问题存在的时候要。正文里已经答完的页面不必再复述一遍,而凑数的 FAQ 会把它所在的页面稀释掉。
整页有长度目标吗?
没有一个我们敢替它辩护的。我们量过页面长度和别的东西的关系,没看出干净的相关性,所以不给整页目标,只给每一节的——那才是真正会被用到的单位。
本文属于 QueryWin 实操手册 · 第 2 阶


