GEO对照组怎么设置:用未改动问题和负向提示词排除平台波动

GEO对照组与实验组在90天内的AI提及率曲线对比,两条曲线在模型更新日出现同向跳变

GEO对照组是一组刻意不做任何优化的监测问题,用来测量同一时间窗内平台自身的漂移幅度。实验组的涨幅减去对照组的涨幅,剩下的才是优化真正带来的增量。 没有这一步,AI提及率的曲线上扬只能证明"变了",不能证明"是你干的"。

大多数 GEO 复盘报告的结构是:改了 20 篇内容,六周后提及率从 31% 涨到 46%,结论"优化有效"。同一时间段里模型换了版本、检索索引刷了一轮、竞品也在发稿——这三件事任何一件都能造出 15 个百分点的涨幅。

GEO对照组与实验组在90天内的AI提及率曲线对比,两条曲线在模型更新日出现同向跳变

什么是 GEO对照组

GEO对照组指在实验周期内保持问题措辞、采样频次、账号环境全部冻结,且不接受任何优化动作的一批监测问句。它的作用不是提升数据,而是提供一条"如果什么都不做会发生什么"的基线。

它和传统 A/B 测试的对照组有一个关键区别:传统实验里对照组和实验组面对的是同一个稳定系统,而生成式引擎本身在实验期内会自己变。所以 GEO对照组承担双重任务——既控制样本差异,也记录平台漂移。

学术侧对生成式引擎可见度的量化框架,可参考 KDD 2024 论文 GEO: Generative Engine Optimization 提出的曝光度指标(Position-Adjusted Word Count、Subjective Impression)。但该论文测的是单次生成结果里的位置与词数占比,实验在固定模型版本上完成,没有处理跨时间的漂移——而漂移正是实务验收里最致命的一段。

为什么没有对照组的 GEO 报告不能当验收依据

答案很直接:在 AI 搜索里,"什么都不做"的品牌提及率也会明显移动,幅度经常盖过优化本身。把这段移动算进自己的成绩,验收数字就是虚的。

会伪装成"效果"的波动主要有三类:

  • 模型版本更新:训练语料、对齐策略、推荐倾向整体变化,属于阶跃式跳变,往往一夜之间发生。多数平台会在官方文档留下版本记录,例如 DeepSeek API 文档 会标注模型版本迭代,OpenAI Models 文档会给出各快照的生效日期——实验开始前把这些页面加进监控,比事后猜测有用得多。
  • 检索层与索引刷新:联网检索的召回源更替,引用来源整批换血,品牌被引概率随之抖动。这一层变化最快,也最容易被误读成"我们的内容被收录了"。
  • 采样噪声:同一个问题连问三次,答案可能提到三组不同品牌。这是解码随机性(temperature、top-p 与推理路由共同作用的结果),不是趋势。

三类波动的时间尺度不同:噪声以小时计,检索刷新以天计,模型更新以周或月计。只有对照组能同时吸收这三层,因为它和实验组暴露在完全相同的环境里。

还有一层常被忽略的差异:AI 搜索没有 Search Console 式的官方口径。传统 SEO 里,排名和点击有第三方权威读数兜底;AI 搜索的提及率完全由你自己的采样定义,采样怎么设计,结论就长什么样。对照组是这套自定义口径里唯一的校准物。

实测数据:4 个平台、90 天、43,200 条应答的空转波动

先给结论:在完全不做优化的情况下,周维度AI提及率的标准差平均达到 ±5.8 个百分点,单周最大跳变 17 个百分点。任何低于 8 个百分点的周涨幅,在没有对照组的情况下无法与噪声区分。

数据来自 MaxAEO 监测面板的一次内部空转实验:2026 年 3 月 1 日至 5 月 31 日,选取 40 个消费与 B2B 品类的推荐类问句,在 DeepSeek、豆包、Kimi、通义千问四个平台上每天各采样 3 次,全程不做任何内容、媒体或技术改动,共记录 43,200 条应答(40 问 × 4 平台 × 3 次 × 90 天)。

平台 同日 3 次重复的结果不一致率 周提及率标准差 90 天内单周最大跳变
DeepSeek 14.2% ±4.6 pp +11 pp
豆包 21.7% ±7.1 pp +17 pp
Kimi 23.4% ±6.9 pp −14 pp
通义千问 15.1% ±4.8 pp +9 pp
平均 18.6% ±5.8 pp

四个值得记下的观察:

  1. 同日重复不一致率平均 18.6%,最高的 Kimi 达到 23.4%。单次采样得出的"我们上榜了",有近四分之一概率下一次就不成立。
  2. 90 天里出现 3 次全品类同向漂移,对照问题与非对照问题同时上下 10 个百分点以上,其中 3 月 22 日那次与一次模型版本发布重合。这三次如果落在实验周期内,没有对照组必然误判。
  3. 引用来源的更替速度快于提及本身:对照问题的引用域名 30 天重合度中位数只有 62%,约 38% 的引用链接会自然换掉。把引用变化当成"内容被采纳"的证据,需要格外谨慎。
  4. 噪声水平与品类竞争密度正相关:答案里平均出现 6 个以上候选品牌的问句,周标准差是候选品牌 3 个以内问句的 1.9 倍(±7.4 pp vs ±3.9 pp)。拥挤品类要么加大样本,要么把验收门槛调高,不能沿用同一套阈值。

对照问题怎么匹配:六条规则和一次真实的配对失败

对照问题不能随手挑。匹配的目标是让对照组和实验组在"除了优化动作以外的一切维度"上尽可能相同,否则两组的漂移速率不一致,减法就失效了。

按优先级排列的六条匹配规则:

规则 具体标准 不满足的后果
意图同类 同为推荐类 / 对比类 / 事实类 不同意图触发的检索行为不同,漂移速率差异大
基线相近 起始提及率差值 ≤5 pp 低基线的天然涨幅空间更大,减法偏乐观
句式相近 字数差 ≤10 字,同为疑问句 措辞长度影响召回文档数量
竞争密度相近 答案中出现的候选品牌数差 ≤2 拥挤品类的位次更不稳定
检索行为一致 同为触发联网检索或同为不触发 混搭会把检索层噪声只灌进一组
引用源不重叠 对照问题的引用域名与本次改动的页面交集为空 对照组被优化外溢污染,减法把真实效果抹掉

最后一条最容易漏掉,也最致命。在一次为客户搭建实验的过程中,我们按前五条规则配好 24 组问题,跑引用源交叉检查时发现 7 组(29%)的对照问题正在引用即将被改写的页面。不替换的话,这些对照问题会跟着实验组一起涨,最终算出来的净效果被压掉将近一半。

规则六的执行方式很机械:先抓取每个候选对照问题最近 30 天的全部引用 URL,与本次改动清单做域名+路径级比对,有交集就换问题。B2B 品类的问句还要多一层区分——B2B企业怎么做GEO里的供应商初筛、技术评估、采购尽调三类问句,检索行为差别很大,跨阶段配对基本配不平。

负向提示词对照怎么设计:安慰剂、虚构实体、反向意图

负向对照是不指望出现品牌、或指望结果保持不变的探针,用来验证测量链路本身没坏。正向对照回答"涨了多少是真的",负向对照回答"这套数据能不能信"。

三类负向提示词各有分工:

  • 安慰剂问题(placebo prompt):品类相关但与本次优化主题完全无关的问句。例如优化的是"敏感肌面霜怎么选",安慰剂就问"卸妆油和卸妆膏哪个更适合油皮"。预期:提及率不动。若它跟着涨,说明涨的是品牌整体权重,而不是这次内容。
  • 虚构实体探针(fake-entity probe):在问句里塞一个不存在的品牌名或型号,比如"XX 牌 T7 净味洗衣机口碑如何"。预期:各平台均无实质推荐。若虚构实体被"认真"回答且提及率随时间上升,说明模型幻觉率升高或采集链路被污染,当期数据不可用于验收。
  • 反向意图问题(negative-intent prompt):主动问缺点,如"XX 品牌有哪些常被吐槽的问题"。预期:负向语境提及占比稳定。这一组同时兼任AI舆情哨兵——提及率涨了但负面语境同步涨,是需要立刻处理的信号,而不是成绩。

三类探针的数量不必对等。实测里虚构实体探针最省——每平台 5 条即可,因为它的预期值是零,任何非零都是明确信号;安慰剂需要 8–10 条才能把自身噪声压到 ±3 pp 以内,否则它自己的波动会盖过要检测的外溢。

一个实操细节:负向对照的采样频次要和实验组完全一致,不能因为"预期不变"就降频。降频会让它失去在模型更新当天报警的能力。关于第三方可以怎样刻意扰动这类信号,AI 搜索会被操纵吗里的内容投毒与刷推荐手法值得对照着读——虚构实体探针恰好是最早能发现投毒的探针类型。

三类负向提示词的预期响应曲线示意:安慰剂持平、虚构实体归零、反向意图占比稳定

三种对照组结构怎么选

按实验单元不同,GEO对照组有三种搭法,选择取决于这次改动的作用范围。

结构 对照单元 适用场景 主要优点 主要风险
问题级对照 未改动的问句 单主题、单页面优化 搭建最快,成本最低 引用源外溢污染
页面级对照 未改动的页面群 站内批量改版 隔离边界清晰 需要足够多的同类页面
品牌级对照 自有子品牌或竞品 全站改版、公关投放 能覆盖平台级整体漂移 竞品也在优化,基线会动

默认选问题级:成本最低、执行最快,绝大多数内容优化都够用。只有当改动波及整站模板或技术层(例如可抓取性改造)时,才升级到页面级——那时所有问题都被影响了,问题级对照根本找不到干净的对照。

品牌级对照要慎用。用竞品当对照,前提是竞品在同期没有做 GEO 动作,而这一点你无法验证。更稳的做法是把竞品数据当"平台大盘指数"而不是严格对照组:三家以上竞品的提及率均值同向移动,基本可判定为平台侧变化。

效果怎么算:双重差分与最小可检出提升

核心公式只有一行:

真实增量 =(实验组期末 − 实验组期初)−(对照组期末 − 对照组期初)

这就是双重差分(Difference-in-Differences)。它的前提假设是"平行趋势":如果不做优化,两组会以相同速率移动。所以实验开始前必须先跑 2–4 周的预观测期,确认两组曲线大致平行,再开始改动。跳过预观测期的对照组,等于用一个未经检验的假设做验收。

样本量决定了你能看见多小的提升。按上文实测的 ±5.8 pp 周标准差、80% 把握度、双侧 95% 估算:

采样规模(单平台) 可检出的最小真实提升
10 问题 × 每天 3 次 × 14 天 约 15 pp
20 问题 × 每天 3 次 × 14 天 约 10 pp
40 问题 × 每天 3 次 × 28 天 约 5 pp
40 问题 × 每天 3 次 × 56 天 约 3 pp

读法很实际:只监控 10 个问题、只跑两周,小于 15 个百分点的提升根本看不出来,报出去的任何数字都是噪声。想验收 5 个百分点级别的改善,起步就是 40 个问题、四周。

注意一个常见的自欺:同一天的 3 次采样不是 3 个独立样本。它们共享同一个模型版本和同一份检索索引,有效样本量远小于名义条数。加采样频次对压噪声的边际收益,明显低于加问题数量——要提高检出能力,先加问题,再加天数,最后才考虑加频次

这也是很多 GEO 服务合同里 KPI 定不下来的技术原因:GEO 服务合同里的 KPI 怎么定讨论了哪些结果适合写进验收条款,哪些不该硬性承诺;如果对照组方案要写进招标文件,GEO项目招标需求书怎么写里的数据与交付物条款可以直接套用。

一手案例:护肤品牌 6 周实验,15 个百分点里只有 9 个是自己的

某国产护肤品牌(已脱敏)2026 年 4 月做了一次内容改造:重写 18 篇成分科普与选购指南,补充结构化对比表和第三方检测数据引用。实验组 24 个问题,对照组 24 个按六条规则匹配的问句,四个平台每天各采样 3 次,共 6 周。

指标 实验组 第 0 周 实验组 第 6 周 对照组 第 0 周 对照组 第 6 周 双重差分
提及率 31% 46% 28% 34% +9 pp
首位推荐率 9% 17% 8% 10% +6 pp
自有域名引用占比 12% 27% 11% 13% +13 pp
负向语境提及占比 6% 5% 6% 6% −1 pp

三个能直接拿去用的结论:

  1. 表面 +15 pp 的提及率涨幅里,只有 9 pp 属于这次优化,剩下 6 pp 是平台大盘同期上移。如果按 15 pp 汇报,下季度按同样口径考核就会翻车。
  2. 引用占比的净增幅(+13 pp)大于推荐位次的净增幅(+6 pp)。动作先在引用层生效,再传导到推荐层——第 2 周引用占比已经动了,提及率到第 4 周才明显起来,中间隔了大约两周。
  3. 同期跑的虚构实体探针全程零提及,安慰剂问题波动在 ±3 pp 内,证明采集链路没有污染,这 9 pp 可以采信

一个反直觉的细节:四个平台的净效果差异极大。同一批内容在 DeepSeek 上净增 14 pp,在豆包上只有 3 pp。平台级拆分必须做,否则均值会把"在一个平台上很有效"包装成"整体有效",下一步的资源分配就投错了方向。

对照组失效的七个信号

出现以下任一情况,当期结论应该作废或降级为"仅供参考":

  1. 预观测期两组曲线不平行,斜率差超过 2 pp/周。
  2. 对照问题的引用来源里出现了本次改动的页面。
  3. 实验期内平台发生模型版本更新,且更新前后未做分段检验。
  4. 虚构实体探针开始被"认真"回答,说明幻觉率或采集链路异常。
  5. 对照组样本在实验中途被增删,导致前后口径不一致。
  6. 两组采样时段、账号、地域或提问顺序不一致。
  7. 对照组问题数少于 15 个,噪声吞掉了全部信号。

第 3 条有个务实做法:不要粗暴剔除模型更新当天的数据,而是把实验期切成更新前、更新后两段分别做双重差分。两段净效果方向一致,结论更稳;方向相反,说明优化效果高度依赖特定模型版本,这本身就是重要发现。

第 6 条在多人协作时最容易踩坑:不同成员用各自账号补跑采样,登录态、历史对话记忆、地域路由都不一样,数据混进同一张表就再也拆不开了。采样账号、代理出口和提问顺序应当写进实验参数文档并锁死,谁补跑都用同一套。

14 天搭建流程

按顺序执行,两周可以把一套可用的 GEO对照组跑起来:

  1. 第 1–2 天:确定实验范围,列出本次将改动的全部页面与主题,形成"改动清单"。
  2. 第 3–4 天:从现有监测词库中筛出 24–40 个实验组问题,按意图、基线、句式、竞争密度四条规则各配一个候选对照问题。
  3. 第 5 天:抓取候选对照问题近 30 天的引用 URL,与改动清单做交叉比对,剔除有交集的组,补足数量。
  4. 第 6 天:写入三类负向提示词,虚构实体每平台不少于 5 条、安慰剂 8–10 条、反向意图不少于 5 条,采样频次与主实验一致。
  5. 第 7–13 天:进入预观测期,全平台每天 3 次采样,不做任何改动,检查两组曲线是否平行。
  6. 第 14 天:确认平行趋势成立、噪声水平在预期内,冻结问题清单与采样参数,正式开始改动。

冻结之后,问题措辞、采样频次、账号环境三项在实验结束前一律不动

工具与数据要求:自己搭还是买平台

对照组能不能跑起来,取决于监控侧的四项能力,缺一项这套方法就降级成猜测:

能力 最低要求 缺失后果
原始应答留存 保存全文而非只存"是否提及" 无法回溯语境,负向意图组失效
引用 URL 明细 逐条记录来源域名+路径 规则六无法执行,外溢污染查不出来
问题分组标签 支持实验组/对照组/负向组打标 双重差分只能靠人工拉表
采样环境可控 账号、地域、频次可固定并留痕 失效信号第 6 条无从验证

自建脚本能满足前两项,但分组与环境留痕的工程量通常被低估——尤其是长期历史数据的存储和回溯查询。选型阶段的验证要点见AI搜索监控工具怎么选,把这四项能力当成 POC 的验收项、用两周跑一遍数据可信度检查的做法见AI 搜索监控 POC 怎么做

常见问题

对照组需要多少个问题才够?
最少 15 个,推荐 24–40 个。按 ±5.8 pp 的周标准差估算,20 个问题跑两周只能检出 10 pp 以上的提升,40 个问题跑四周可以下探到 5 pp。问题少于 15 个时,单个问题的随机翻转就能改变整组结论。

能直接用竞品数据当 GEO对照组吗?
不建议当严格对照组,因为你无法确认竞品同期没有做优化。更稳妥的用法是取三家以上竞品的提及率均值作为"平台大盘指数",用来识别整体漂移方向;真正的减法仍然由自己那批未改动问题来做。

模型更新当天的数据要不要剔除?
不剔除,改为分段。把实验期切成更新前后两段分别计算双重差分,比直接删数据保留更多信息。两段结论方向一致才算稳;方向相反说明效果依赖特定模型版本。

对照组也涨了,还能说优化有效吗?
能,只要实验组涨得更多,且差值超过最小可检出提升。这正是双重差分的价值——它不要求对照组不动,只要求两组在没有干预时同速移动。真正需要警惕的是差值落在噪声范围内却被当成成绩汇报。

只监控一个 AI 平台可以做对照组吗?
可以,但结论只对该平台成立。不同平台的噪声水平差异很大,实测中 Kimi 的重复不一致率是 DeepSeek 的 1.6 倍,案例里同一批内容在 DeepSeek 与豆包上的净效果相差 11 pp。至少覆盖两个平台,才能区分"平台特性"与"品牌层面变化"。

对照组要跑多久才能停?
最短 4 周,含 2 周预观测期。内容型改动的引用层通常在 2 周内先动、推荐层滞后 2–4 周,实验期短于 4 周会只抓到引用变化、误判为"没效果"。技术型改动(可抓取性、结构化数据)传导更慢,建议留到 8 周。

对照组问题被竞品优化影响了怎么办?
这属于正常环境变化,不需要剔除——竞品动作对两组的影响是同向的,双重差分会自动吸收。只有当竞品明确针对实验组问题做定向投放(例如集中发稿覆盖同一批问句)时,才需要标注该问题并单独做敏感性分析。

做对照组的成本大概是多少?
主要成本是采样量:40 问题 × 4 平台 × 3 次 × 每天,对照组等量,一个月约 3 万条应答,是不做对照组的 2 倍。按监控词与平台数计费的定价逻辑见GEO工具价格怎么看。这笔钱换的是"敢不敢把数字写进验收报告",通常比一次误判的返工便宜。