存量内容 AEO 改造:几百篇博客先改哪 10%(引用潜力打分法)

内容库 412 篇按四档分类的分布柱状图,标注各档占比与优先级

存量内容 AEO 改造的正确起手式是筛选,不是重写。 在 300–500 篇的内容库里,值得优先动的通常只有 8%–12%:其余要么已经在被 AI 引用(改了反而破坏),要么主题根本不在用户会问的问题里(改了也没人问)。

这篇给出一套一个下午能跑完的筛选方法:四档分类 → 五维引用潜力分(CPS)→ 按档位派工单 → 14 天验证。文中的 412 篇演算来自我们对一个中文 B2B SaaS 内容库的完整跑分,口径和中间数字都写出来了,可以直接套自己的库。

什么是存量内容 AEO 改造,和常规内容更新差在哪

存量内容 AEO 改造,指对已发布的老页面做结构性改写,让单个段落能被 AI 整段摘录并标注为来源,而不只是提升传统搜索排名。 它改的是可摘录性和证据密度,不是关键词密度。

两者的判断标准完全不同:

常规内容更新 存量内容 AEO 改造
目标单位 整页排名 单个段落被摘录
成功信号 排名位次、点击 回答里标注你的 URL 为来源
主要动作 补关键词、扩字数 前置结论、加表格、补具名数据
失败原因 覆盖不足 答案埋太深、无法独立读懂

同一篇文章可以排名第 3 却从不被 AI 引用——因为答案埋在第 800 字,而模型只会抓走能脱离上下文独立成立的那一段。这也是为什么"排名好的文章不用改"是错的:排名和被引用是两条通路。

为什么不能全站重写:三笔算得出来的账

第一笔:单位问题成本账

以 412 篇内容库为例,按每篇平均 1.5 小时实质改写计:

方案 工时 覆盖问题数 单位问题成本
全站重写 412 篇 618 小时 约 240 个 2.6 小时
只改前 10%(41 篇) 52 小时 约 96 个 0.54 小时
随机改 41 篇 52 小时 约 21 个 2.5 小时

(覆盖问题数口径:改造后该 URL 命中问题库中至少 1 条高频问题即计入,一篇多命中按去重后计数。)

随机改和全站重写的单位成本几乎一样(2.5 vs 2.6 小时),说明规模本身不产生效率,筛选才产生效率。 差别不在"改得好不好",而在改的是不是有人在问的题。

第二笔:引用回撤风险账

已被引用的段落一旦重写,引用可能直接消失。我们在两次改造中观察到:被引用段落改写后,恢复到改前引用频次平均需要 3–5 周,且不保证恢复到原句式。这是把一档单列出来"只防守不重构"的直接原因。

第三笔:抓取预算账

大批量改动会让站点在短期内出现大量 lastmod 变化。Google 官方文档明确说明抓取预算由抓取容量上限和抓取需求共同决定,且大量低价值 URL 会对站点的抓取和索引产生负面影响。全站同时改动的实际后果是:真正重要的那几十篇排在重抓队列后面,见效被拖慢。

内容库 412 篇按四档分类的分布柱状图,标注各档占比与优先级

四档分类法:先把内容库切成四堆

打分之前必须先分类,因为四档的改造动作完全不同,混在一张表里按分数排序会得出错误优先级

分类只看两个客观信号:主题在不在问题库里、监测数据里这个 URL 有没有被列为来源。

档位 判定条件 典型占比 改造动作
一档|已被引用 URL 在 AI 回答的引用来源里出现过 ≥1 次 5%–8% 防守:更新数据,不动结构
二档|接近被引用 主题命中问题库,但被引用的是竞品或第三方 12%–18% 主攻:补可引用块
三档|结构不可读 主题命中,但页面无答案先行块、无表格列表 30%–35% 重构:拆段加结构
四档|主题无关 问题库里没有对应问题 40%–50% 不动:合并、归档或留给传统搜索

执行顺序:先改二档,再改三档中主题命中度最高的一批,一档只做防守,四档不进本轮排期。

二档 ROI 最高的原因很具体:AI 已经在这个问题上给出了回答并引用了别人,说明检索通路是通的、这个问题有检索需求、模型愿意在此处引用外部来源——你缺的只是一段可摘录的文字,不是权威度。三档缺的是结构,一档缺的只是新鲜度。

没有问题库怎么起步

判定四档需要一份真实问题库。如果还没有,用这个降级路径:

  1. 导出过去 90 天品牌词、品类词、竞品对比词在各平台的实际提问变体。
  2. 去重后按月度出现频次排序,取前 200 条作为起步问题库。
  3. 按主题标签归类,一个标签下通常 3–8 条问题,标签数控制在 30–50 个。

不同模型对同一问题的答案分歧越大,说明该问题的引用位越不稳定、越值得优先争夺。关于分歧度实测口径和该优先监测哪些平台,国产 AI 答案分歧度的实测方法有更细的说明。

引用潜力分(CPS)怎么算:五个维度和权重

引用潜力分(CPS)是 100 分制复合分,用于在同一档内部排序,不用于跨档比较。 五个维度各自 0–100 分,加权求和:

CPS = 0.30×主题命中度 + 0.25×引用邻近度 + 0.20×段落可读性 + 0.15×证据密度 + 0.10×更新衰减

维度 权重 打分依据 数据来源
主题命中度 30% 问题月度频次分位 问题库表
引用邻近度 25% 品牌离被引用差几步 监测导出表
段落可读性 20% 四条结构硬指标 内容表 + 人工抽检
证据密度 15% 每千字可核验数据点 人工阅读
更新衰减 10% 距末次实质更新月数 内容表

主题命中度(30%)

对应问题在问题库里的月度频次分位:前 10% 记 100 分,前 30% 记 70 分,命中但低频记 40 分,未命中记 0 分。

权重最高,因为它决定这篇改完有没有流量承接。命中度为 0 的页面无论结构多好都不该进排期。

引用邻近度(25%)

在该问题的 AI 回答里,你的品牌离"被引用"还差几步:

状态 分值
已被引用并标注 URL 100
被提及但未标来源 75
只有竞品被引用 50
双方都没出现 20

这是整套打分里唯一无法靠人工阅读页面得出的信号,只能从监测数据取。ChatGPT 与 Gemini 的来源选择逻辑并不相同——前者依赖搜索工具调用后的重排,后者走 Grounding with Google Search 的检索路径,具体差异见ChatGPT 如何选择与引用来源Gemini 的 Grounding 来源选择机制。做邻近度打分时建议按平台分列,不要合并成一个平均值。

段落可读性(20%)

四条硬指标各 25 分:

  1. 正文前 30% 位置有没有 40–60 字的直接答案块。
  2. 有没有至少一个表格或有序列表。
  3. H2 是不是描述性或问句式(不是"背景介绍"这类空标题)。
  4. 单段是否普遍不超过 4 句。

段落级可引用性的判定标准和改写句式,见段落级可引用性的实测与写法

证据密度(15%)

每 1000 字中可核验的数据点、具名来源、一手案例数量:0 个记 0 分,1–2 个记 50 分,3 个及以上记 100 分。

Google 在《创建有帮助、可靠、以用户为中心的内容》中把"内容是否展示了第一手专业知识与深度"列为自评核心问题,并要求内容提供超出显而易见信息的实质价值。AI 平台的来源选择逻辑与这套自评高度重叠:可核验的具体数字比形容词更容易被整段摘录。

更新衰减(10%)

距上次实质更新(非错别字修改)的月数:≤6 个月记 100,7–12 个月记 70,13–24 个月记 40,超过 24 个月记 10。

权重刻意压低——新鲜度是门槛不是杠杆。一篇结构不可读的新文章依然不会被引用;但一篇 2022 年数据的老文章会在竞品更新后被替换掉。

怎么批量跑:三张表、一个连接键

整套打分不需要专门工具,三张表加一次导出就能跑完。关键是三张表共用同一个连接键:主题标签(不是 URL,也不是关键词——URL 无法多对多,关键词无法归并同义提问)。

  1. 内容表:从 CMS 或 sitemap 导出全部 URL,字段含标题、发布日期、末次更新日期、字数、H2 数量、是否含表格或有序列表。这几个字段决定段落可读性和更新衰减两维。
  2. 问题库表:问题原文、所属主题标签、月度出现频次、当前在各平台被引用的域名。
  3. 监测导出表:问题 × 平台 × 引用 URL × 提及品牌 × 情感倾向。提供引用邻近度,也是一档判定依据。

用主题标签 join 三张表。一篇文章常对应多个问题——取该文命中问题中频次最高的一条作为主题命中度输入,不要取平均,否则长尾问题会稀释分数、把好题压到排期外。把监测异常持续转化成选题排期的完整流水线,见从监测数据到内容排期的搭建方法

跑分前必做:十分钟抓取可达性检查

如果 robots.txt 屏蔽了 AI 爬虫、或正文由客户端 JavaScript 渲染,页面根本进不了检索池,打分再准也白做。 检查三项:

  • robots.txt 里 GPTBotPerplexityBotGoogle-ExtendedClaudeBot 等 UA 是否被 Disallow。
  • 关掉 JavaScript 后正文是否还在(curl 取源码搜首段文字最快)。
  • 是否有登录墙、地区跳转或 Cookie 弹窗遮挡首屏正文。

这一步十分钟,能整批筛掉注定无效的改造工单。

412 篇内容库的完整演算:前 10% 长什么样

用上面的口径对一个中文 B2B SaaS 内容库(412 篇,问题库取前 200 条高频问题)做一次完整跑分:

档位 篇数 占比 该档 CPS 中位数
一档|已被引用 23 5.6% 71
二档|接近被引用 61 14.8% 63
三档|结构不可读 137 33.3% 44
四档|主题无关 191 46.4% 18

前 10%(41 篇)不是简单取 CPS Top 41,而是按档配额:二档 25 篇、三档 12 篇、一档 4 篇。

配额理由:

  • 二档 25 篇是主攻,直接对应可争夺的引用位,单篇改造对应 1–2 个已验证有检索需求的问题。
  • 三档 12 篇只取主题命中度 ≥70 分的,这批是"好题烂结构",改造收益最陡——结构成本低(约 1 小时),而题本身已被验证有人问。
  • 一档 4 篇是防守配额,专挑更新衰减分低于 40 的老引用页,防止已有引用因数据过期被竞品替换。

三档 CPS 中位数只有 44,但它贡献了整个内容库最大的可改造存量。如果只按 CPS 全局排序,三档会被系统性挤出前 41 名——这正是多数内容审计做完没有效果的根本原因:分数把"结构差但题好"和"题也差"混为一谈了。

四档配额分配示意图,展示存量内容 AEO 改造前 10% 名单中二档三档一档的篇数构成

每一档具体改什么:三张工单模板

二档工单:补可引用块(单篇 1.5–2 小时)

按顺序做四件事:

  1. 在正文前 30% 位置补一个 40–60 字的直接答案段,句式用"X 是……"或"X 的做法是……"。
  2. 把散落在中后段的结论前置到对应 H2 下第一句。
  3. 加一张对比表或参数表(AI 在"X 和 Y 哪个好"类问题上极度偏好表格结构)。
  4. 补至少一个带具名来源的数据点,把形容词换成数字。

对比类页面的具体写法和表格字段选择,竞品对比页的引用结构有完整示例。定义类问题("X 是什么")另有一套写法,长期看引用红利更稳,见术语表页的定义类引用

三档工单:结构重构(单篇约 1 小时)

只做四件事,不新增内容、不改论点

  1. 拆掉超过 5 句的长段。
  2. 把陈述式 H2 改成问句式或定义式。
  3. 每个 H2 下第一句用"X 是……"或"X 指……"起头。
  4. 给流程类内容加有序列表。

纯结构改造,这也是它单篇工时最低的原因。做完后重新跑一次 CPS,通常段落可读性从 25 分升到 75–100 分,一部分页面会直接升进二档。

一档工单:防守更新(单篇约 20 分钟)

更新过期数字和年份、补内链、修死链,不动已被引用段落的句式和位置

改动记录里单独标注这批 URL,一旦引用消失可快速回滚。首页、产品页、定价页等业务页的防守口径不同于博客——业务页要保住的是套餐名、计费单位、适用规模这类结构化事实,改动时优先对照分页面类型的 AEO 清单执行。

YMYL 主题的额外约束

如果内容库涉及医疗、健康、金融、法律等 YMYL 主题,三档的"纯结构重构"不能照搬:这类页面的结论前置必须同时带上资质署名和信息来源,否则前置了反而放大风险。合规边界和资质信号的具体做法,见医疗健康品牌的 YMYL AEO 红线

改完怎么验证:14 天窗口和三个必看指标

改造上线后不要立刻看结果。AI 平台索引更新有滞后,以 14 天为一个观测窗口,前 7 天不做任何判断

三个指标缺一不可:

指标 定义 反映什么
AI 提及率 目标问题集里出现品牌名的回答占比 召回
引用率 回答明确标注你的 URL 为来源的占比 AEO 改造的直接结果
位置 品牌出现在答案第几句、是否进首推列表 权重与信任度

三者的组合读法比单看任一个更有用:

  • 提及率涨、引用率没动 → 内容被读到了但没被当成依据,补证据密度。
  • 引用率涨、位置靠后 → 已进候选池但不是首选,加对比表和更具体的数字。
  • 三者都没动、但对照组也没动 → 大概率还没重抓,先查 lastmod 和日志里的 AI 爬虫记录。

必须设对照组

为排除模型自身更新带来的波动,同时保留一组不改造的对照页:从二档里 CPS 相近(±5 分内)的篇目随机抽 15–20 篇,全程不动。

单品牌条件下如何构造可信对照组、样本量要多大才能读出信号,AEO holdout 对照测试方法有可复用的实验设计。

遇到模型大版本更新导致推荐结果整体位移时,要重新取基线,不能把变化归因到改造本身——升级后的可见性重估流程见模型大版本更新后的品牌可见性重估

常见问题

存量内容 AEO 改造和重新发一篇新文章,哪个更快见效?

改造更快。老页面已有索引记录、内链和抓取历史,结构改完通常 1–3 周内可观察到引用变化;新页面从零累积一般需要 2–3 个月。前提是主题命中问题库——主题不对的老页面改了也不会有引用。

四档分类里第四档的内容要不要删掉?

不建议直接删。四档只是"不在本轮 AEO 排期内",它们可能仍在承接传统搜索流量。处理顺序:先看有无自然流量 → 有流量的保留 → 无流量且主题重复的合并到同主题主页面并做 301 → 完全过时的才归档。

没有 AI 监测数据,这套打分还能用吗?

能用,但引用邻近度这一维(25%)会缺失。降级方案是把权重重新分配给主题命中度(40%)和段落可读性(30%),先做一轮纯结构筛选。缺点很明确:无法区分二档和三档,会把大量"好结构但没人问"的页面排到前面。建议至少手工在 3–5 个平台上跑一遍前 20 条高频问题,人工记录引用域名,够撑起一档判定。

一篇文章改完多久能看出是不是白改了?

14 天窗口内引用率、提及率、位置三项全无变化,且对照组同期也无变化,先查抓取而不是查内容:看 lastmod 是否更新、服务器日志里有没有 AI 爬虫的新一次抓取记录。确认已重抓仍无变化的,通常是主题命中度打分虚高——回头核对该文对应的问题在问题库里的真实频次分位。

每篇文章改完要不要更新发布日期?

只在做了实质改动时更新 dateModified,不要改 datePublished。三档的纯结构重构算实质改动,一档的错别字修正不算。伪造更新时间对引用没有帮助,内容与日期明显不符时反而损伤信任信号。

前 10% 改完之后,下一轮从哪里开始?

用同一套口径重新跑分。经过一轮改造后,问题库通常新增 20–40 条问题(来自监测中新出现的提问变体),二档构成会变;同时上一轮三档改造完成的页面会有一部分升级进二档。把打分周期固定为季度一次,比一次性做完整审计更可持续。