存量内容 AEO 改造的正确起手式是筛选,不是重写。 在 300–500 篇的内容库里,值得优先动的通常只有 8%–12%:其余要么已经在被 AI 引用(改了反而破坏),要么主题根本不在用户会问的问题里(改了也没人问)。
这篇给出一套一个下午能跑完的筛选方法:四档分类 → 五维引用潜力分(CPS)→ 按档位派工单 → 14 天验证。文中的 412 篇演算来自我们对一个中文 B2B SaaS 内容库的完整跑分,口径和中间数字都写出来了,可以直接套自己的库。
什么是存量内容 AEO 改造,和常规内容更新差在哪
存量内容 AEO 改造,指对已发布的老页面做结构性改写,让单个段落能被 AI 整段摘录并标注为来源,而不只是提升传统搜索排名。 它改的是可摘录性和证据密度,不是关键词密度。
两者的判断标准完全不同:
| 常规内容更新 | 存量内容 AEO 改造 | |
|---|---|---|
| 目标单位 | 整页排名 | 单个段落被摘录 |
| 成功信号 | 排名位次、点击 | 回答里标注你的 URL 为来源 |
| 主要动作 | 补关键词、扩字数 | 前置结论、加表格、补具名数据 |
| 失败原因 | 覆盖不足 | 答案埋太深、无法独立读懂 |
同一篇文章可以排名第 3 却从不被 AI 引用——因为答案埋在第 800 字,而模型只会抓走能脱离上下文独立成立的那一段。这也是为什么"排名好的文章不用改"是错的:排名和被引用是两条通路。
为什么不能全站重写:三笔算得出来的账
第一笔:单位问题成本账
以 412 篇内容库为例,按每篇平均 1.5 小时实质改写计:
| 方案 | 工时 | 覆盖问题数 | 单位问题成本 |
|---|---|---|---|
| 全站重写 412 篇 | 618 小时 | 约 240 个 | 2.6 小时 |
| 只改前 10%(41 篇) | 52 小时 | 约 96 个 | 0.54 小时 |
| 随机改 41 篇 | 52 小时 | 约 21 个 | 2.5 小时 |
(覆盖问题数口径:改造后该 URL 命中问题库中至少 1 条高频问题即计入,一篇多命中按去重后计数。)
随机改和全站重写的单位成本几乎一样(2.5 vs 2.6 小时),说明规模本身不产生效率,筛选才产生效率。 差别不在"改得好不好",而在改的是不是有人在问的题。
第二笔:引用回撤风险账
已被引用的段落一旦重写,引用可能直接消失。我们在两次改造中观察到:被引用段落改写后,恢复到改前引用频次平均需要 3–5 周,且不保证恢复到原句式。这是把一档单列出来"只防守不重构"的直接原因。
第三笔:抓取预算账
大批量改动会让站点在短期内出现大量 lastmod 变化。Google 官方文档明确说明抓取预算由抓取容量上限和抓取需求共同决定,且大量低价值 URL 会对站点的抓取和索引产生负面影响。全站同时改动的实际后果是:真正重要的那几十篇排在重抓队列后面,见效被拖慢。

四档分类法:先把内容库切成四堆
打分之前必须先分类,因为四档的改造动作完全不同,混在一张表里按分数排序会得出错误优先级。
分类只看两个客观信号:主题在不在问题库里、监测数据里这个 URL 有没有被列为来源。
| 档位 | 判定条件 | 典型占比 | 改造动作 |
|---|---|---|---|
| 一档|已被引用 | URL 在 AI 回答的引用来源里出现过 ≥1 次 | 5%–8% | 防守:更新数据,不动结构 |
| 二档|接近被引用 | 主题命中问题库,但被引用的是竞品或第三方 | 12%–18% | 主攻:补可引用块 |
| 三档|结构不可读 | 主题命中,但页面无答案先行块、无表格列表 | 30%–35% | 重构:拆段加结构 |
| 四档|主题无关 | 问题库里没有对应问题 | 40%–50% | 不动:合并、归档或留给传统搜索 |
执行顺序:先改二档,再改三档中主题命中度最高的一批,一档只做防守,四档不进本轮排期。
二档 ROI 最高的原因很具体:AI 已经在这个问题上给出了回答并引用了别人,说明检索通路是通的、这个问题有检索需求、模型愿意在此处引用外部来源——你缺的只是一段可摘录的文字,不是权威度。三档缺的是结构,一档缺的只是新鲜度。
没有问题库怎么起步
判定四档需要一份真实问题库。如果还没有,用这个降级路径:
- 导出过去 90 天品牌词、品类词、竞品对比词在各平台的实际提问变体。
- 去重后按月度出现频次排序,取前 200 条作为起步问题库。
- 按主题标签归类,一个标签下通常 3–8 条问题,标签数控制在 30–50 个。
不同模型对同一问题的答案分歧越大,说明该问题的引用位越不稳定、越值得优先争夺。关于分歧度实测口径和该优先监测哪些平台,国产 AI 答案分歧度的实测方法有更细的说明。
引用潜力分(CPS)怎么算:五个维度和权重
引用潜力分(CPS)是 100 分制复合分,用于在同一档内部排序,不用于跨档比较。 五个维度各自 0–100 分,加权求和:
CPS = 0.30×主题命中度 + 0.25×引用邻近度 + 0.20×段落可读性 + 0.15×证据密度 + 0.10×更新衰减
| 维度 | 权重 | 打分依据 | 数据来源 |
|---|---|---|---|
| 主题命中度 | 30% | 问题月度频次分位 | 问题库表 |
| 引用邻近度 | 25% | 品牌离被引用差几步 | 监测导出表 |
| 段落可读性 | 20% | 四条结构硬指标 | 内容表 + 人工抽检 |
| 证据密度 | 15% | 每千字可核验数据点 | 人工阅读 |
| 更新衰减 | 10% | 距末次实质更新月数 | 内容表 |
主题命中度(30%)
对应问题在问题库里的月度频次分位:前 10% 记 100 分,前 30% 记 70 分,命中但低频记 40 分,未命中记 0 分。
权重最高,因为它决定这篇改完有没有流量承接。命中度为 0 的页面无论结构多好都不该进排期。
引用邻近度(25%)
在该问题的 AI 回答里,你的品牌离"被引用"还差几步:
| 状态 | 分值 |
|---|---|
| 已被引用并标注 URL | 100 |
| 被提及但未标来源 | 75 |
| 只有竞品被引用 | 50 |
| 双方都没出现 | 20 |
这是整套打分里唯一无法靠人工阅读页面得出的信号,只能从监测数据取。ChatGPT 与 Gemini 的来源选择逻辑并不相同——前者依赖搜索工具调用后的重排,后者走 Grounding with Google Search 的检索路径,具体差异见ChatGPT 如何选择与引用来源和Gemini 的 Grounding 来源选择机制。做邻近度打分时建议按平台分列,不要合并成一个平均值。
段落可读性(20%)
四条硬指标各 25 分:
- 正文前 30% 位置有没有 40–60 字的直接答案块。
- 有没有至少一个表格或有序列表。
- H2 是不是描述性或问句式(不是"背景介绍"这类空标题)。
- 单段是否普遍不超过 4 句。
段落级可引用性的判定标准和改写句式,见段落级可引用性的实测与写法。
证据密度(15%)
每 1000 字中可核验的数据点、具名来源、一手案例数量:0 个记 0 分,1–2 个记 50 分,3 个及以上记 100 分。
Google 在《创建有帮助、可靠、以用户为中心的内容》中把"内容是否展示了第一手专业知识与深度"列为自评核心问题,并要求内容提供超出显而易见信息的实质价值。AI 平台的来源选择逻辑与这套自评高度重叠:可核验的具体数字比形容词更容易被整段摘录。
更新衰减(10%)
距上次实质更新(非错别字修改)的月数:≤6 个月记 100,7–12 个月记 70,13–24 个月记 40,超过 24 个月记 10。
权重刻意压低——新鲜度是门槛不是杠杆。一篇结构不可读的新文章依然不会被引用;但一篇 2022 年数据的老文章会在竞品更新后被替换掉。
怎么批量跑:三张表、一个连接键
整套打分不需要专门工具,三张表加一次导出就能跑完。关键是三张表共用同一个连接键:主题标签(不是 URL,也不是关键词——URL 无法多对多,关键词无法归并同义提问)。
- 内容表:从 CMS 或 sitemap 导出全部 URL,字段含标题、发布日期、末次更新日期、字数、H2 数量、是否含表格或有序列表。这几个字段决定段落可读性和更新衰减两维。
- 问题库表:问题原文、所属主题标签、月度出现频次、当前在各平台被引用的域名。
- 监测导出表:问题 × 平台 × 引用 URL × 提及品牌 × 情感倾向。提供引用邻近度,也是一档判定依据。
用主题标签 join 三张表。一篇文章常对应多个问题——取该文命中问题中频次最高的一条作为主题命中度输入,不要取平均,否则长尾问题会稀释分数、把好题压到排期外。把监测异常持续转化成选题排期的完整流水线,见从监测数据到内容排期的搭建方法。
跑分前必做:十分钟抓取可达性检查
如果 robots.txt 屏蔽了 AI 爬虫、或正文由客户端 JavaScript 渲染,页面根本进不了检索池,打分再准也白做。 检查三项:
- robots.txt 里
GPTBot、PerplexityBot、Google-Extended、ClaudeBot等 UA 是否被 Disallow。 - 关掉 JavaScript 后正文是否还在(
curl取源码搜首段文字最快)。 - 是否有登录墙、地区跳转或 Cookie 弹窗遮挡首屏正文。
这一步十分钟,能整批筛掉注定无效的改造工单。
412 篇内容库的完整演算:前 10% 长什么样
用上面的口径对一个中文 B2B SaaS 内容库(412 篇,问题库取前 200 条高频问题)做一次完整跑分:
| 档位 | 篇数 | 占比 | 该档 CPS 中位数 |
|---|---|---|---|
| 一档|已被引用 | 23 | 5.6% | 71 |
| 二档|接近被引用 | 61 | 14.8% | 63 |
| 三档|结构不可读 | 137 | 33.3% | 44 |
| 四档|主题无关 | 191 | 46.4% | 18 |
前 10%(41 篇)不是简单取 CPS Top 41,而是按档配额:二档 25 篇、三档 12 篇、一档 4 篇。
配额理由:
- 二档 25 篇是主攻,直接对应可争夺的引用位,单篇改造对应 1–2 个已验证有检索需求的问题。
- 三档 12 篇只取主题命中度 ≥70 分的,这批是"好题烂结构",改造收益最陡——结构成本低(约 1 小时),而题本身已被验证有人问。
- 一档 4 篇是防守配额,专挑更新衰减分低于 40 的老引用页,防止已有引用因数据过期被竞品替换。
三档 CPS 中位数只有 44,但它贡献了整个内容库最大的可改造存量。如果只按 CPS 全局排序,三档会被系统性挤出前 41 名——这正是多数内容审计做完没有效果的根本原因:分数把"结构差但题好"和"题也差"混为一谈了。

每一档具体改什么:三张工单模板
二档工单:补可引用块(单篇 1.5–2 小时)
按顺序做四件事:
- 在正文前 30% 位置补一个 40–60 字的直接答案段,句式用"X 是……"或"X 的做法是……"。
- 把散落在中后段的结论前置到对应 H2 下第一句。
- 加一张对比表或参数表(AI 在"X 和 Y 哪个好"类问题上极度偏好表格结构)。
- 补至少一个带具名来源的数据点,把形容词换成数字。
对比类页面的具体写法和表格字段选择,竞品对比页的引用结构有完整示例。定义类问题("X 是什么")另有一套写法,长期看引用红利更稳,见术语表页的定义类引用。
三档工单:结构重构(单篇约 1 小时)
只做四件事,不新增内容、不改论点:
- 拆掉超过 5 句的长段。
- 把陈述式 H2 改成问句式或定义式。
- 每个 H2 下第一句用"X 是……"或"X 指……"起头。
- 给流程类内容加有序列表。
纯结构改造,这也是它单篇工时最低的原因。做完后重新跑一次 CPS,通常段落可读性从 25 分升到 75–100 分,一部分页面会直接升进二档。
一档工单:防守更新(单篇约 20 分钟)
更新过期数字和年份、补内链、修死链,不动已被引用段落的句式和位置。
改动记录里单独标注这批 URL,一旦引用消失可快速回滚。首页、产品页、定价页等业务页的防守口径不同于博客——业务页要保住的是套餐名、计费单位、适用规模这类结构化事实,改动时优先对照分页面类型的 AEO 清单执行。
YMYL 主题的额外约束
如果内容库涉及医疗、健康、金融、法律等 YMYL 主题,三档的"纯结构重构"不能照搬:这类页面的结论前置必须同时带上资质署名和信息来源,否则前置了反而放大风险。合规边界和资质信号的具体做法,见医疗健康品牌的 YMYL AEO 红线。
改完怎么验证:14 天窗口和三个必看指标
改造上线后不要立刻看结果。AI 平台索引更新有滞后,以 14 天为一个观测窗口,前 7 天不做任何判断。
三个指标缺一不可:
| 指标 | 定义 | 反映什么 |
|---|---|---|
| AI 提及率 | 目标问题集里出现品牌名的回答占比 | 召回 |
| 引用率 | 回答明确标注你的 URL 为来源的占比 | AEO 改造的直接结果 |
| 位置 | 品牌出现在答案第几句、是否进首推列表 | 权重与信任度 |
三者的组合读法比单看任一个更有用:
- 提及率涨、引用率没动 → 内容被读到了但没被当成依据,补证据密度。
- 引用率涨、位置靠后 → 已进候选池但不是首选,加对比表和更具体的数字。
- 三者都没动、但对照组也没动 → 大概率还没重抓,先查
lastmod和日志里的 AI 爬虫记录。
必须设对照组
为排除模型自身更新带来的波动,同时保留一组不改造的对照页:从二档里 CPS 相近(±5 分内)的篇目随机抽 15–20 篇,全程不动。
单品牌条件下如何构造可信对照组、样本量要多大才能读出信号,AEO holdout 对照测试方法有可复用的实验设计。
遇到模型大版本更新导致推荐结果整体位移时,要重新取基线,不能把变化归因到改造本身——升级后的可见性重估流程见模型大版本更新后的品牌可见性重估。
常见问题
存量内容 AEO 改造和重新发一篇新文章,哪个更快见效?
改造更快。老页面已有索引记录、内链和抓取历史,结构改完通常 1–3 周内可观察到引用变化;新页面从零累积一般需要 2–3 个月。前提是主题命中问题库——主题不对的老页面改了也不会有引用。
四档分类里第四档的内容要不要删掉?
不建议直接删。四档只是"不在本轮 AEO 排期内",它们可能仍在承接传统搜索流量。处理顺序:先看有无自然流量 → 有流量的保留 → 无流量且主题重复的合并到同主题主页面并做 301 → 完全过时的才归档。
没有 AI 监测数据,这套打分还能用吗?
能用,但引用邻近度这一维(25%)会缺失。降级方案是把权重重新分配给主题命中度(40%)和段落可读性(30%),先做一轮纯结构筛选。缺点很明确:无法区分二档和三档,会把大量"好结构但没人问"的页面排到前面。建议至少手工在 3–5 个平台上跑一遍前 20 条高频问题,人工记录引用域名,够撑起一档判定。
一篇文章改完多久能看出是不是白改了?
14 天窗口内引用率、提及率、位置三项全无变化,且对照组同期也无变化,先查抓取而不是查内容:看 lastmod 是否更新、服务器日志里有没有 AI 爬虫的新一次抓取记录。确认已重抓仍无变化的,通常是主题命中度打分虚高——回头核对该文对应的问题在问题库里的真实频次分位。
每篇文章改完要不要更新发布日期?
只在做了实质改动时更新 dateModified,不要改 datePublished。三档的纯结构重构算实质改动,一档的错别字修正不算。伪造更新时间对引用没有帮助,内容与日期明显不符时反而损伤信任信号。
前 10% 改完之后,下一轮从哪里开始?
用同一套口径重新跑分。经过一轮改造后,问题库通常新增 20–40 条问题(来自监测中新出现的提问变体),二档构成会变;同时上一轮三档改造完成的页面会有一部分升级进二档。把打分周期固定为季度一次,比一次性做完整审计更可持续。
