AEO A/B测试怎么做:页面、问题、模型三种实验单元怎么选

AEO A/B测试三种实验单元的污染风险、随机化可行性与最小样本量对比表

大部分 AEO 实验在第一步就注定失败:把"改了哪个页面"当实验单元,却用"提及率有没有涨"当结论,中间隔着一层根本没随机化的观测。

这篇文章拆解三种实验单元的适用边界,给出可复算的样本量表、重复采样的有效样本上限公式,以及一份开跑前就要锁定的实验登记模板。

AEO A/B测试是什么

AEO A/B测试是指固定其他条件、只改动一个可控因素,通过对比实验组与对照组在 AI 答案中的提及率、引用率和排序位置差异,判断该因素是否具有因果效应的实验方法。

它能做,但只能在"页面组"或"问题簇"两个层级上随机化。难点来自三个结构性事实:

  • 答案是概率采样的。同一问题问两次结果可能不同,天然带噪声。这是传统 A/B 测试没有的方差来源。
  • 无法做用户级分流。你没法让一半访问者看 A 版、一半看 B 版——DeepSeek、豆包、Kimi、通义千问抓到的是同一个 URL 的同一份内容。
  • 平台自己在漂移。模型版本、检索策略、索引刷新都会造成整体位移,把你的实验效果吞掉或放大。

这三点决定了:AEO 实验设计要向聚类随机试验靠拢,而不是向网页转化率优化靠拢。

三种实验单元有什么区别

实验单元是随机化被施加的那个对象。 页面单元把网页分组,问题单元把提问分组,模型单元把平台分组——三者可行性差异极大。

AEO A/B测试三种实验单元的污染风险、随机化可行性与最小样本量对比表

实验单元 能否真正随机化 主要污染源 最小规模要求 适用场景
页面单元(改哪些页) 可以,但只能按页面组 同模板页面互相引流;一个页面同时服务多个问题;对爬虫和用户显示不同版本触发合规风险 同模板页面 ≥ 40 个,实验组对照组各 20 模板化改造:产品页、对比页、定价页批量加结论段或结构化数据
问题单元(看哪些问) 可以,且最容易执行 溢出效应——改一个页面会同时影响对照组里指向同一页面的问题 题库 ≥ 150 题,且需按落地页聚类分组 单页面深度改写、内容格式实验、答案先行结构验证
模型单元(哪个平台) 不能——你无法给平台随机分配版本 平台自身版本更新、地域差异、账号与联网开关差异全部混杂在一起 不适用 只能作分层因子和漂移基线,不能作实验单元

关键结论在最后一行:跨平台比较不是实验,是观察。 把"豆包提及率比 DeepSeek 高"当实验结论,等于把两家公司的模型迭代节奏算进了你的内容改动效果里。

页面单元:污染最重,但改动最直接

页面单元适合模板化改造。 把 40 个同模板页面随机分成两半,一半加"答案先行"摘要段和结构化数据,另一半保持原样,观察两组被引用频次差异。SearchPilot、SplitSignal 这类 SEO 分组分流测试工具用的就是同一个思路。

三个污染源必须提前处理:

  • 模板不同质:产品页 A 有 3000 字评测,产品页 B 只有 200 字规格表,随机分组分不平就带来系统性偏差。做法是先按字数、外链数、历史流量分层,再在层内随机。
  • 内部互链串味:实验组页面互相链接会放大效果,实验组链到对照组会稀释效果。测试期内冻结全站内链改动
  • 合规红线:绝不能"给爬虫看 A 版、给用户看 B 版"。这在 Google 的定义里就是伪装(cloaking),属明确禁止行为,见 Google 搜索中心的垃圾内容政策。AI 平台抓取器同样会比对渲染结果。国内的边界问题另见 AI 推荐优化的合规红线

页面单元的正确用法,是把"改什么"落在页面上,把"看什么"落在问题上——两者分开记账。具体改哪些字段,对照分页面类型的 AEO 改造清单执行。

问题单元:唯一能高频随机化的单元

问题单元是把题库随机分成实验组和对照组,实验组的问题指向被改动的内容,对照组的问题指向未改动的内容。 三种单元里唯一能在一周内跑起来、且能持续加大样本的选择。

但它有一个致命陷阱:溢出效应。假设你改写了一篇"CRM 系统怎么选"的长文,题库里有 12 道题最终都检索到这篇文章。把其中 6 道分进对照组,对照组也被"处理"了,实验效果会被系统性低估。

正确做法是按落地页做聚类随机:先把每道题映射到它最可能命中的落地页,再以"页面"为整体单位随机分配,同一页面下的所有问题必须整体进同一组。这会让有效样本量下降(下一节会算),但结论才成立。

问题单元还需要分层,避免高价值问题全部集中在一组:

  1. 意图类型分层:认知类("什么是…")、对比类("X 和 Y 哪个好")、决策类("…哪家便宜")、故障类("…怎么解决")。
  2. 品牌相关度分层:明确带品牌名的问题、只带品类词的问题、带竞品名的问题。
  3. 基线提及率分层:已稳定被提及的问题和从未被提及的问题分开——前者测排序位置,后者测有无。

题库从哪来

题库不够大是绝大多数团队卡住的地方。三个来源按性价比排序:

  • 搜索下拉与相关问题:把品类词丢进搜索框,收集下拉联想和"相关搜索",直接转成问句。成本最低,覆盖真实需求。
  • 销售与客服记录:客户在售前问的原话就是最好的题干,且天然带决策意图。这批题的商业价值最高。
  • 竞品对比句式扩展:用"品牌 A 和 品牌 B 哪个好/哪个便宜/哪个适合 X 规模"三段式批量组合。40 个竞品组合就能产出 120 道题。

提醒:题干一旦定稿就不能再改。措辞变了,问题本身就成了变量。

模型单元:它是分层因子,不是实验单元

模型单元不能做随机化,因为你无法给平台随机分配"处理"或"不处理"。 DeepSeek、豆包、Kimi、通义千问各自的模型版本、检索策略、内容源权重都由平台方决定,你只是观察者。

典型错误:在 DeepSeek 上跑 A 版、在豆包上跑 B 版,然后宣布 B 版更好。这里至少混杂了模型能力差异、索引覆盖差异、答案长度偏好差异三个变量,结论无效。

正确用法有两个:

  • 分层分析:同一套实验在每个平台内部各跑一遍对照,最后看效应方向是否一致。四个平台里三个方向一致,才算稳健。
  • 漂移基线:把一批完全未改动的问题在所有平台上持续监测。如果这批问题的提及率也整体上涨,说明是平台侧变化,不是你的功劳。这组数据是排除平台波动的唯一凭据。

另外,不联网、不检索的纯模型对话可充当负向对照:你改了官网内容,纯离线模型的答案理应不变。它变了,说明你观测到的是采样噪声。

AEO A/B测试要多少样本才够

结论先行:检测"提及率从 20% 涨到 30%"这种量级的变化,双侧 α=0.05、统计功效 80% 的条件下,每组需要 294 次独立观测。 这是两组独立比例 z 检验的标准结果,可自行复算。

不同基线提及率下检测 AI 提及率提升所需的每组最少观测数对比图

基线提及率 目标提及率 绝对提升 每组最少有效观测数
5% 10% +5pp 435
10% 20% +10pp 199
20% 25% +5pp 1094
20% 30% +10pp 294
20% 40% +20pp 82
30% 45% +15pp 163

看第三行:基线 20% 想验证 5 个百分点的提升,每组要 1094 次观测。 大多数品牌的题库根本没这么大,这就是为什么"我改了页面,提及率从 20% 到 25%"这类汇报几乎全是噪声。要么把预期效应做大,要么承认测不出来。

重复采样为什么不能替代扩大题库

同一道题反复问 10 次,得到的不是 10 次独立观测。同题重复高度相关——有些问题就是稳定提及你,有些就是稳定不提。这需要用设计效应修正:

设计效应 DEFF = 1 + (m − 1) × ICC
有效观测数 n_eff = k × m / DEFF
其中 k = 题目数,m = 每题重复次数,ICC = 组内相关系数

当 m 趋向无穷时,n_eff 的极限是 k / ICC有效样本量存在硬上限,加重复次数永远突破不了题库规模决定的天花板。

代入实测常见的 ICC≈0.6:

  • 200 道题 × 每题 5 次 = 1000 次观测,DEFF = 3.4,有效观测约 294 —— 刚好够检测 20%→30%。
  • 只有 100 道题,无论重复多少次,有效观测上限是 100/0.6 ≈ 167,永远测不出 10 个百分点的提升
  • 反推最低题库规模:k ≥ n_eff × ICC = 294 × 0.6 ≈ 177 题

优先级明确:先扩题库,再加重复次数。 加题目提升的是上限,加重复只是逼近上限。

ICC 要自己实测,不能照抄 0.6。方法:取 30 道代表性问题,每题在同一平台重复 10 次,用单因素方差分析算 ICC = (MSB − MSW) / (MSB + (m−1) × MSW)。题库越同质、平台采样温度越低,ICC 越高。

这也解释了为什么公开研究的结论不能直接搬用。普林斯顿等机构的 GEO 研究(arXiv:2311.09735)在约一万条查询的基准集上报告,加入引用、统计数据和权威引述等改写可让来源可见度最高提升 40%。但那是跨品类基准集的平均值,你所在品类的基线提及率、竞争密度、内容源结构都不同——40% 是"值得去试"的量级信号,不是你的预期收益。这正是必须自己做 AEO A/B测试的原因。

一次实验大概要花多少

按题库 320 题、四个平台、每题重复 5 次算,单轮读数 = 320 × 4 × 5 = 6400 次查询。加上前测基线一轮,一次完整实验约 1.3 万次查询。这个量级决定了三件事:

  • 必须用接口或自动化脚本采集,人工点不动。
  • 采样时段要固定,不能今天白天跑一半、明天凌晨跑一半。
  • 单轮跑完通常需要 1–3 天,这个时间要算进实验周期,不要压缩到读数期以外。

预算紧张时的取舍顺序:先砍平台数(从四个降到两个),再砍重复次数(5 次降到 3 次),最后才砍题目数——题目数是有效样本上限,砍它等于直接放弃结论。低成本执行路径见没预算也能做 AEO 的 10 件事

一次只改一个因素的实验登记模板

实验登记表要在开跑前写完并锁定,事后不能改判读规则。 这是把 AEO 实验和"改完看看"区分开的唯一硬性动作。

AEO A/B测试实验登记表示例,包含冻结清单、单一变量说明与预设判读规则

按顺序填写以下 10 项:

  1. 假设:写成"改动 X 会让 Y 指标从 a 变到 b"。例:"在对比页开头加 60 字结论段,会让对比类问题的提及率从 18% 升到 30%。"
  2. 实验单元与随机化方式:页面组分层随机 / 问题簇聚类随机,二选一,写明分层变量。
  3. 唯一变量:只写一条。写不成一条,说明这是多变量实验,先拆成多轮串行实验,不要一次上。
  4. 冻结清单:测试期内不动的东西——内链结构、发布节奏、外部投放、schema 字段、页面 URL、robots 规则、外部媒体稿。
  5. 题库与分组:题目总数、每组题数、分层比例、每题重复次数、聚类映射表。
  6. 采样设置:平台清单、账号类型、地区、是否开启联网检索、采样时段(固定时段,避开平台发版窗口)。
  7. 主指标与护栏指标:主指标一个(如提及率或引用率);护栏指标至少两个——情感倾向和引用来源准确性。主指标涨了但答案里说错了你的定价,是负收益。
  8. 时间窗口:改动冻结日、等待期、读数期各自的起止日期。等待期至少留 14 天:抓取、重新索引、答案引用三段延迟叠加,改完第二天读数只能读到索引延迟。
  9. 判读规则:预先写死。例:"实验组减对照组的提及率差值 ≥ 8pp,且 95% 置信区间下限 > 0,且四个平台中至少三个方向一致,才判定为有效。"
  10. 回滚与放量:判定无效时是否回滚、判定有效时下一批推广到哪些页面。

第 9 项最容易被跳过。判读规则写在看到数据之后,就不叫实验了。

适合先测的五个因素

不知道从哪个变量开始,按预期效应量从大到小排:

待测因素 改动成本 预期效应 适用页面
开头加 40–60 字直接结论段 全部内容页
表格化对比信息(替代段落描述) 对比页、定价页
补齐 FAQPage 结构化数据 有问答区的页面
定价、规格等数字从图片改成文本 定价页、参数页
增加术语定义段 品类科普页

先测预期效应大的——效应越大,需要的样本量越小(回看样本量表:20pp 提升只要 82 次观测,5pp 要 1094 次)。

五个最常见的设计错误

共同点:都会产出看起来能汇报的数字,但数字本身没有因果含义。

  • 用不同措辞的问题去比 A 和 B。"MaxAEO 好用吗"和"MaxAEO 值得买吗"检索到的内容源可能完全不同。措辞变了,问题就成了变量,实验作废。对照组必须用完全相同的问句
  • 在页面单元上做用户级分流。给爬虫和用户返回不同内容属于伪装,风险远大于收益。
  • 抢跑读数。内容改完第二天就查提及率,测的是索引延迟,不是内容质量。
  • 同时改内容、外部媒体和技术。三件事一起上,涨了也不知道算谁的,只能得到一个无法复用的结论。
  • 只看提及率,不看引用来源。提及率涨了但引用的全是第三方测评站,说明你没拿到内容主权;下次那家站点改口,你的可见度就跟着掉。对比页的改写要点见竞品对比页的引用优化

三种单元怎么组合成一次完整实验

三种单元不是三选一,而是各司其职:页面单元决定"改什么",问题单元决定"看什么",模型单元决定"怎么分层读数"。

一次完整的 AEO A/B测试长这样:

  1. 选定一个页面模板(如全部对比页),随机分成实验组和对照组各 20 个页面。
  2. 为每个页面映射 8–10 道问题,形成 ≥ 320 道题的题库,按落地页整体归组。
  3. 另留 50 道完全不涉及改动页面的问题作漂移基线。
  4. 只改实验组页面的一个因素,冻结其余一切。
  5. 等待期结束后,在四个平台上各跑一轮,每题重复 5 次。
  6. 先看漂移基线:如果基线组也涨了,先把这部分整体涨幅扣掉。
  7. 分平台计算实验组与对照组的提及率差值和置信区间,按预设规则判读。

成本主要压在题库建设和监测执行上,这两部分可自动化,选型维度见 AI 搜索优化工具的选型对比。改动内容本身怎么写才容易被准确引用,见 AI 搜索内容优化方法

三条可复算的硬门槛,把它们写进登记表,能挡掉九成注定得不出结论的实验:

  • 想验证 10 个百分点的提升,每组需要 294 次有效观测。
  • ICC=0.6 时,题库不足 177 题就永远测不出来。
  • 重复采样的有效样本上限是 k / ICC,加次数突破不了。

常见问题

AEO A/B测试和传统 SEO A/B 测试有什么区别?

传统 SEO A/B 测试的观测量是曝光和点击,来自搜索控制台的稳定时间序列,可用因果推断模型做页面组对照。AEO 场景没有这套曝光数据,观测量是"某道题的答案里有没有提到你",是二元的、带采样噪声的、需要主动查询才能获得的。所以 AEO 更依赖题库规模和重复采样,统计方法从时间序列因果推断转向两组比例检验。

题库只有 50 道题,还能做实验吗?

能做探索,不能做判定。50 道题在 ICC=0.6 时有效样本上限约 83,只够检测 20 个百分点以上的大幅变化。这种规模适合定性观察——看答案引用了哪些来源、你的品牌被放在什么位置、描述是否准确,这些不需要统计显著性也有价值。要出因果结论,先把题库扩到 150 题以上。

每题重复几次比较合适?

3–5 次。低于 3 次噪声太大,高于 5 次边际收益迅速衰减——ICC=0.6 时,从 5 次加到 10 次,单题贡献的有效观测只从 1.47 涨到 1.61,涨幅不到 10%,监测成本却翻倍。省下的预算加题目,回报高得多。

四个平台结果不一致怎么判读?

看方向而不是看幅度。四个平台中三个方向一致、且合并后的置信区间下限大于零,可判定有效。如果只有一个平台涨、其余持平或跌,大概率是那个平台当期发生了索引刷新,应延长观测期再读一次,同时检查漂移基线组在该平台的表现。

实验期间平台更新了模型版本,数据还能用吗?

分两种情况。更新发生在读数期之前、且实验组对照组同时受影响,数据仍可用,因为对照组吸收了这部分变化。更新发生在读数期中途,就把读数期切成更新前后两段分别计算,两段方向一致才采信;不一致就作废重跑。这也是必须记录每次采样的具体日期和平台版本的原因。

一次 AEO A/B测试要跑多久?

内容冻结日算起,等待期 14 天 + 读数期 3–7 天,合计 3–4 周。想缩短只有一个合法办法:提前把题库和采集脚本准备好,让等待期和建设期重叠。压缩等待期只会让你读到索引延迟。

提及率和引用率该选哪个当主指标?

选一个,别两个都当主指标(会推高假阳性)。提及率衡量品牌有没有出现在答案文本里,基线通常更高、更容易测出差异,适合大多数实验。引用率衡量你的 URL 有没有被列进来源,更能反映内容主权,但基线更低、需要更大样本。经验做法:主指标用提及率,引用率放护栏指标里跟踪。