ai 搜索优化:被摘走的是一节,不是一整页

ai 搜索优化在排版这一层只答一个问题:能回答问题的那段文字从哪儿开始到哪儿结束。六条可核对的结构规则,外加一条中文独有的:把「铺垫」倒过来写。

排名与引用6 分钟读完2247 次阅读
ai 搜索优化:被摘走的是一节,不是一整页

ai 搜索优化在排版这一层只回答一个问题:一段能回答问题的文字,从哪儿开始,到哪儿结束。标题划出这个边界,每个标题下的第一句承载结论,三个变量以上的事实一律上表格。这一篇是那份模板,每条规则都给了能核对的数字。

读这篇前

结构是第二个问题。第一个是引擎能不能取到你的页面、交付的 HTML 里有没有文字——那是geo 优化的第一步,那一关不过的页面,本篇写的对它一条都不成立。

写什么也是另一个问题。哪些结论值得写、怎么措辞才经得起被单独摘走,在内容怎么写才会被 AI 引用里。本篇默认你已经知道这一页是干什么的。

被摘走的单位是一节,不是一整页

答案引擎不会引用你的文章,它引用的是一段文字,然后把出处标成你的网址。所以设计目标是:整页由一节节各自独立成立的文字组成,而不是一篇必须顺着读下来才成立的文章。

这带来一个跟中文写作训练直接冲突的结论:节与节之间的过渡句是废重量。「说完前一部分,我们接着来看」这种句子只在线性阅读里有用,而它占掉的正是一节里最该放结论的那一行。

🔴 中文写作最大的敌人是「铺垫」

这一节是中文读者独有的。中文议论文的训练是先交代背景、再层层递进、最后给结论——放在提取场景里,这个顺序正好是反的。一段用行业大势起头、结论落在第三段的文字,机器摘不走:它要么连铺垫一起摘(那句结论就被稀释了),要么什么都不摘。

改法不是把文章写短,是把每一节的顺序倒过来:结论先落地,条件和背景跟在后面。整篇文章的信息量一点不减,只是每一节都变成了可以单独拎出来的东西。

模板

六条规则。每一条都不用工具就能核对,所以它们写成的是数字,不是建议。

元素规则怎么核对
h1正好一个,说清这页是什么curl 取回来数
开篇段40–80 字答完标题数字数
每个 h2是断言或问句,不是标签抽出来单独读一遍
h2 下第一句就是答案,一句话删掉后面的,看它还成不成立
表格三个变量以上一律上表数你本来要写进句子的列
FAQ 问句用真实搜索原话拿去跑一遍下拉联想

把所有 h2 抽出来单独读一遍

把页面里每个 h2 按顺序抽成一个纯列表,别的什么都不留。如果这个列表读起来像整篇文章的摘要,结构就是对的;如果读起来像一份由名词组成的目录,就是错的。

这条之所以成立,是因为标题是提取方在决定「这一节相不相关」之前唯一能便宜读到的部分。一个只点出话题的标题让它去猜,一个直接给出断言的标题当场就把问题答了。

标签式标题断言式标题
概述为什么光靠 robots.txt 拦不住 AI 爬虫
实现方式一条命令查完 14 个爬虫
总结发现是 CDN 在挡的时候该怎么办

80 字这个数是怎么来的

每个标题下的头 40 到 80 字里把答案给完。下限的存在是因为比这更短的结论通常会漏掉自己的成立条件,被单独摘走之后就不再为真。上限的存在是因为比这更长的一段会开始依赖它上面那句话。

这是一条工作约定,不是测出来的阈值。我们没有测过被引率和段落长度的关系,所以就这么说,而不是把一条写作惯例包装成一个发现。能指出来的是它挡掉的那种失败:一节的第一句是背景、答案在第三段才出现,那么摘它就必须连铺垫一起摘。

三个变量以上就上表格

句子是装结构化事实的差容器。三个站、每个两项属性,写成句子就成了一段谁也从里面抽不出单独一行的文字;同样的内容做成表格,就给了引擎六个可寻址的格子。

经验判据:一旦你发现自己在写「A 是 X,而 B 是 Y,C 则是 Z」,停下来,做成三行。我们自己那些实测文就是照这个写的,而表格恰恰是被读得最多的部分。

FAQ 的问句必须是别人的话

按被打进搜索框的样子写,不是按开会时的说法写。「挡了 GPTBot,ChatGPT 就不会引用我了吗」是一个真实问句的形状;「关于爬虫管理的若干考量」根本不是问句。

每个准备用的问句,定稿前拿去跑一遍下拉联想。如果这个说法什么都不出、而一个更糙的版本出了,就用糙的那个——被真正打出来的是糙的那个。

结构救不了什么

这些都不能让一个内容单薄的页面变得值得引用。结构决定一个好结论能不能被找到并摘走,它对「这个结论值不值得摘」一句话都说不了。一个结构完美但没什么可断言的页面,是一个组织得很好的空。

它也扛不住渲染问题。我们抓的 27 个首页里有 6 个连 h1 都没有,其中一个只交付了 3 KB 的加载器——那一页上所有结构决定都要等 JavaScript 跑完才存在。那篇实测是h1 标签:27 个首页有 6 个一个都没有,在你花一天调标题层级之前值得先读它。

我们也无法告诉你照这么做被引率会上升。没有公开数据把段落结构和被选中挂起来,我们不会去编一个数字。这份模板做的是消掉那些能观察到的失败:摘不走的段落、寻不到址的事实、没人会问的问题。

做错了会怎样

下面三种都会产出一个作者看着没问题、机器读起来完全摘不走的页面——这是最糟的组合,因为没有任何信号提示你哪里不对。

  1. 标题最后才写,当成给已完成段落贴的标签。它描述的会是文字的形状,不是文字说了什么。
  2. 答案埋在铺垫底下。任何以「在看这个之前」开头的一节,都已经把自己的结论推出了可及范围。
  3. FAQ 是在工位上想出来的。没人会打的问句什么都匹配不上,而且那一块在人读起来也像凑数。

交付物:ai 搜索优化的五步结构自查

挑一个你在意的页面,按顺序跑。这份清单故意做得很机械,因为对着自己的稿子时,最先失灵的就是对结构的判断力。

  1. 用 curl 取回页面,数 h1 标签——答案必须是 1。
  2. 把所有 h2 抽成一个纯列表读一遍。不像摘要,就先改标题,别动别的。
  3. 逐节删掉第一句之后的所有内容,看那一句还答不答得了它自己的标题。
  4. 找出每一段含三个以上可比事实的文字,改成表格。
  5. 把每个 FAQ 问句跑一遍下拉联想,零结果的换掉。

第二步和第三步能抓出其中大部分。把这套自查在每一页上跑一遍、而不是只跑你想起来的那一页,正是 QueryWin 要做的事。

常见问题

一页该有几个 h2?

有几个结论就有几个。一页只有一个结论却挂了八个标题,那就是七个标题底下装着凑数的内容——抽出来当列表读一遍就看得很清楚。

标题顺序重要吗?

对人重要。对提取没那么重要,每一节是被独立寻址的。按人读的逻辑排,机器那一侧自然就够用了。

每页都要有 FAQ 吗?

只在真有问题存在的时候要。正文里已经答完的页面不必再复述一遍,而凑数的 FAQ 会把它所在的页面稀释掉。

整页有长度目标吗?

没有一个我们敢替它辩护的。我们量过页面长度和别的东西的关系,没看出干净的相关性,所以不给整页目标,只给每一节的——那才是真正会被用到的单位。

本文属于 QueryWin 实操手册 · 第 2 阶

ai 搜索优化:被摘走的是一节,不是一整页