大部分 AEO 实验在第一步就注定失败:把"改了哪个页面"当实验单元,却用"提及率有没有涨"当结论,中间隔着一层根本没随机化的观测。
这篇文章拆解三种实验单元的适用边界,给出可复算的样本量表、重复采样的有效样本上限公式,以及一份开跑前就要锁定的实验登记模板。
AEO A/B测试是什么
AEO A/B测试是指固定其他条件、只改动一个可控因素,通过对比实验组与对照组在 AI 答案中的提及率、引用率和排序位置差异,判断该因素是否具有因果效应的实验方法。
它能做,但只能在"页面组"或"问题簇"两个层级上随机化。难点来自三个结构性事实:
- 答案是概率采样的。同一问题问两次结果可能不同,天然带噪声。这是传统 A/B 测试没有的方差来源。
- 无法做用户级分流。你没法让一半访问者看 A 版、一半看 B 版——DeepSeek、豆包、Kimi、通义千问抓到的是同一个 URL 的同一份内容。
- 平台自己在漂移。模型版本、检索策略、索引刷新都会造成整体位移,把你的实验效果吞掉或放大。
这三点决定了:AEO 实验设计要向聚类随机试验靠拢,而不是向网页转化率优化靠拢。
三种实验单元有什么区别
实验单元是随机化被施加的那个对象。 页面单元把网页分组,问题单元把提问分组,模型单元把平台分组——三者可行性差异极大。

| 实验单元 | 能否真正随机化 | 主要污染源 | 最小规模要求 | 适用场景 |
|---|---|---|---|---|
| 页面单元(改哪些页) | 可以,但只能按页面组 | 同模板页面互相引流;一个页面同时服务多个问题;对爬虫和用户显示不同版本触发合规风险 | 同模板页面 ≥ 40 个,实验组对照组各 20 | 模板化改造:产品页、对比页、定价页批量加结论段或结构化数据 |
| 问题单元(看哪些问) | 可以,且最容易执行 | 溢出效应——改一个页面会同时影响对照组里指向同一页面的问题 | 题库 ≥ 150 题,且需按落地页聚类分组 | 单页面深度改写、内容格式实验、答案先行结构验证 |
| 模型单元(哪个平台) | 不能——你无法给平台随机分配版本 | 平台自身版本更新、地域差异、账号与联网开关差异全部混杂在一起 | 不适用 | 只能作分层因子和漂移基线,不能作实验单元 |
关键结论在最后一行:跨平台比较不是实验,是观察。 把"豆包提及率比 DeepSeek 高"当实验结论,等于把两家公司的模型迭代节奏算进了你的内容改动效果里。
页面单元:污染最重,但改动最直接
页面单元适合模板化改造。 把 40 个同模板页面随机分成两半,一半加"答案先行"摘要段和结构化数据,另一半保持原样,观察两组被引用频次差异。SearchPilot、SplitSignal 这类 SEO 分组分流测试工具用的就是同一个思路。
三个污染源必须提前处理:
- 模板不同质:产品页 A 有 3000 字评测,产品页 B 只有 200 字规格表,随机分组分不平就带来系统性偏差。做法是先按字数、外链数、历史流量分层,再在层内随机。
- 内部互链串味:实验组页面互相链接会放大效果,实验组链到对照组会稀释效果。测试期内冻结全站内链改动。
- 合规红线:绝不能"给爬虫看 A 版、给用户看 B 版"。这在 Google 的定义里就是伪装(cloaking),属明确禁止行为,见 Google 搜索中心的垃圾内容政策。AI 平台抓取器同样会比对渲染结果。国内的边界问题另见 AI 推荐优化的合规红线。
页面单元的正确用法,是把"改什么"落在页面上,把"看什么"落在问题上——两者分开记账。具体改哪些字段,对照分页面类型的 AEO 改造清单执行。
问题单元:唯一能高频随机化的单元
问题单元是把题库随机分成实验组和对照组,实验组的问题指向被改动的内容,对照组的问题指向未改动的内容。 三种单元里唯一能在一周内跑起来、且能持续加大样本的选择。
但它有一个致命陷阱:溢出效应。假设你改写了一篇"CRM 系统怎么选"的长文,题库里有 12 道题最终都检索到这篇文章。把其中 6 道分进对照组,对照组也被"处理"了,实验效果会被系统性低估。
正确做法是按落地页做聚类随机:先把每道题映射到它最可能命中的落地页,再以"页面"为整体单位随机分配,同一页面下的所有问题必须整体进同一组。这会让有效样本量下降(下一节会算),但结论才成立。
问题单元还需要分层,避免高价值问题全部集中在一组:
- 按意图类型分层:认知类("什么是…")、对比类("X 和 Y 哪个好")、决策类("…哪家便宜")、故障类("…怎么解决")。
- 按品牌相关度分层:明确带品牌名的问题、只带品类词的问题、带竞品名的问题。
- 按基线提及率分层:已稳定被提及的问题和从未被提及的问题分开——前者测排序位置,后者测有无。
题库从哪来
题库不够大是绝大多数团队卡住的地方。三个来源按性价比排序:
- 搜索下拉与相关问题:把品类词丢进搜索框,收集下拉联想和"相关搜索",直接转成问句。成本最低,覆盖真实需求。
- 销售与客服记录:客户在售前问的原话就是最好的题干,且天然带决策意图。这批题的商业价值最高。
- 竞品对比句式扩展:用"品牌 A 和 品牌 B 哪个好/哪个便宜/哪个适合 X 规模"三段式批量组合。40 个竞品组合就能产出 120 道题。
提醒:题干一旦定稿就不能再改。措辞变了,问题本身就成了变量。
模型单元:它是分层因子,不是实验单元
模型单元不能做随机化,因为你无法给平台随机分配"处理"或"不处理"。 DeepSeek、豆包、Kimi、通义千问各自的模型版本、检索策略、内容源权重都由平台方决定,你只是观察者。
典型错误:在 DeepSeek 上跑 A 版、在豆包上跑 B 版,然后宣布 B 版更好。这里至少混杂了模型能力差异、索引覆盖差异、答案长度偏好差异三个变量,结论无效。
正确用法有两个:
- 分层分析:同一套实验在每个平台内部各跑一遍对照,最后看效应方向是否一致。四个平台里三个方向一致,才算稳健。
- 漂移基线:把一批完全未改动的问题在所有平台上持续监测。如果这批问题的提及率也整体上涨,说明是平台侧变化,不是你的功劳。这组数据是排除平台波动的唯一凭据。
另外,不联网、不检索的纯模型对话可充当负向对照:你改了官网内容,纯离线模型的答案理应不变。它变了,说明你观测到的是采样噪声。
AEO A/B测试要多少样本才够
结论先行:检测"提及率从 20% 涨到 30%"这种量级的变化,双侧 α=0.05、统计功效 80% 的条件下,每组需要 294 次独立观测。 这是两组独立比例 z 检验的标准结果,可自行复算。

| 基线提及率 | 目标提及率 | 绝对提升 | 每组最少有效观测数 |
|---|---|---|---|
| 5% | 10% | +5pp | 435 |
| 10% | 20% | +10pp | 199 |
| 20% | 25% | +5pp | 1094 |
| 20% | 30% | +10pp | 294 |
| 20% | 40% | +20pp | 82 |
| 30% | 45% | +15pp | 163 |
看第三行:基线 20% 想验证 5 个百分点的提升,每组要 1094 次观测。 大多数品牌的题库根本没这么大,这就是为什么"我改了页面,提及率从 20% 到 25%"这类汇报几乎全是噪声。要么把预期效应做大,要么承认测不出来。
重复采样为什么不能替代扩大题库
同一道题反复问 10 次,得到的不是 10 次独立观测。同题重复高度相关——有些问题就是稳定提及你,有些就是稳定不提。这需要用设计效应修正:
设计效应 DEFF = 1 + (m − 1) × ICC
有效观测数 n_eff = k × m / DEFF
其中 k = 题目数,m = 每题重复次数,ICC = 组内相关系数
当 m 趋向无穷时,n_eff 的极限是 k / ICC。有效样本量存在硬上限,加重复次数永远突破不了题库规模决定的天花板。
代入实测常见的 ICC≈0.6:
- 200 道题 × 每题 5 次 = 1000 次观测,DEFF = 3.4,有效观测约 294 —— 刚好够检测 20%→30%。
- 只有 100 道题,无论重复多少次,有效观测上限是 100/0.6 ≈ 167,永远测不出 10 个百分点的提升。
- 反推最低题库规模:
k ≥ n_eff × ICC = 294 × 0.6 ≈ 177 题。
优先级明确:先扩题库,再加重复次数。 加题目提升的是上限,加重复只是逼近上限。
ICC 要自己实测,不能照抄 0.6。方法:取 30 道代表性问题,每题在同一平台重复 10 次,用单因素方差分析算 ICC = (MSB − MSW) / (MSB + (m−1) × MSW)。题库越同质、平台采样温度越低,ICC 越高。
这也解释了为什么公开研究的结论不能直接搬用。普林斯顿等机构的 GEO 研究(arXiv:2311.09735)在约一万条查询的基准集上报告,加入引用、统计数据和权威引述等改写可让来源可见度最高提升 40%。但那是跨品类基准集的平均值,你所在品类的基线提及率、竞争密度、内容源结构都不同——40% 是"值得去试"的量级信号,不是你的预期收益。这正是必须自己做 AEO A/B测试的原因。
一次实验大概要花多少
按题库 320 题、四个平台、每题重复 5 次算,单轮读数 = 320 × 4 × 5 = 6400 次查询。加上前测基线一轮,一次完整实验约 1.3 万次查询。这个量级决定了三件事:
- 必须用接口或自动化脚本采集,人工点不动。
- 采样时段要固定,不能今天白天跑一半、明天凌晨跑一半。
- 单轮跑完通常需要 1–3 天,这个时间要算进实验周期,不要压缩到读数期以外。
预算紧张时的取舍顺序:先砍平台数(从四个降到两个),再砍重复次数(5 次降到 3 次),最后才砍题目数——题目数是有效样本上限,砍它等于直接放弃结论。低成本执行路径见没预算也能做 AEO 的 10 件事。
一次只改一个因素的实验登记模板
实验登记表要在开跑前写完并锁定,事后不能改判读规则。 这是把 AEO 实验和"改完看看"区分开的唯一硬性动作。

按顺序填写以下 10 项:
- 假设:写成"改动 X 会让 Y 指标从 a 变到 b"。例:"在对比页开头加 60 字结论段,会让对比类问题的提及率从 18% 升到 30%。"
- 实验单元与随机化方式:页面组分层随机 / 问题簇聚类随机,二选一,写明分层变量。
- 唯一变量:只写一条。写不成一条,说明这是多变量实验,先拆成多轮串行实验,不要一次上。
- 冻结清单:测试期内不动的东西——内链结构、发布节奏、外部投放、schema 字段、页面 URL、robots 规则、外部媒体稿。
- 题库与分组:题目总数、每组题数、分层比例、每题重复次数、聚类映射表。
- 采样设置:平台清单、账号类型、地区、是否开启联网检索、采样时段(固定时段,避开平台发版窗口)。
- 主指标与护栏指标:主指标一个(如提及率或引用率);护栏指标至少两个——情感倾向和引用来源准确性。主指标涨了但答案里说错了你的定价,是负收益。
- 时间窗口:改动冻结日、等待期、读数期各自的起止日期。等待期至少留 14 天:抓取、重新索引、答案引用三段延迟叠加,改完第二天读数只能读到索引延迟。
- 判读规则:预先写死。例:"实验组减对照组的提及率差值 ≥ 8pp,且 95% 置信区间下限 > 0,且四个平台中至少三个方向一致,才判定为有效。"
- 回滚与放量:判定无效时是否回滚、判定有效时下一批推广到哪些页面。
第 9 项最容易被跳过。判读规则写在看到数据之后,就不叫实验了。
适合先测的五个因素
不知道从哪个变量开始,按预期效应量从大到小排:
| 待测因素 | 改动成本 | 预期效应 | 适用页面 |
|---|---|---|---|
| 开头加 40–60 字直接结论段 | 低 | 大 | 全部内容页 |
| 表格化对比信息(替代段落描述) | 中 | 大 | 对比页、定价页 |
| 补齐 FAQPage 结构化数据 | 低 | 中 | 有问答区的页面 |
| 定价、规格等数字从图片改成文本 | 中 | 中 | 定价页、参数页 |
| 增加术语定义段 | 低 | 中 | 品类科普页 |
先测预期效应大的——效应越大,需要的样本量越小(回看样本量表:20pp 提升只要 82 次观测,5pp 要 1094 次)。
五个最常见的设计错误
共同点:都会产出看起来能汇报的数字,但数字本身没有因果含义。
- 用不同措辞的问题去比 A 和 B。"MaxAEO 好用吗"和"MaxAEO 值得买吗"检索到的内容源可能完全不同。措辞变了,问题就成了变量,实验作废。对照组必须用完全相同的问句。
- 在页面单元上做用户级分流。给爬虫和用户返回不同内容属于伪装,风险远大于收益。
- 抢跑读数。内容改完第二天就查提及率,测的是索引延迟,不是内容质量。
- 同时改内容、外部媒体和技术。三件事一起上,涨了也不知道算谁的,只能得到一个无法复用的结论。
- 只看提及率,不看引用来源。提及率涨了但引用的全是第三方测评站,说明你没拿到内容主权;下次那家站点改口,你的可见度就跟着掉。对比页的改写要点见竞品对比页的引用优化。
三种单元怎么组合成一次完整实验
三种单元不是三选一,而是各司其职:页面单元决定"改什么",问题单元决定"看什么",模型单元决定"怎么分层读数"。
一次完整的 AEO A/B测试长这样:
- 选定一个页面模板(如全部对比页),随机分成实验组和对照组各 20 个页面。
- 为每个页面映射 8–10 道问题,形成 ≥ 320 道题的题库,按落地页整体归组。
- 另留 50 道完全不涉及改动页面的问题作漂移基线。
- 只改实验组页面的一个因素,冻结其余一切。
- 等待期结束后,在四个平台上各跑一轮,每题重复 5 次。
- 先看漂移基线:如果基线组也涨了,先把这部分整体涨幅扣掉。
- 分平台计算实验组与对照组的提及率差值和置信区间,按预设规则判读。
成本主要压在题库建设和监测执行上,这两部分可自动化,选型维度见 AI 搜索优化工具的选型对比。改动内容本身怎么写才容易被准确引用,见 AI 搜索内容优化方法。
三条可复算的硬门槛,把它们写进登记表,能挡掉九成注定得不出结论的实验:
- 想验证 10 个百分点的提升,每组需要 294 次有效观测。
- ICC=0.6 时,题库不足 177 题就永远测不出来。
- 重复采样的有效样本上限是
k / ICC,加次数突破不了。
常见问题
AEO A/B测试和传统 SEO A/B 测试有什么区别?
传统 SEO A/B 测试的观测量是曝光和点击,来自搜索控制台的稳定时间序列,可用因果推断模型做页面组对照。AEO 场景没有这套曝光数据,观测量是"某道题的答案里有没有提到你",是二元的、带采样噪声的、需要主动查询才能获得的。所以 AEO 更依赖题库规模和重复采样,统计方法从时间序列因果推断转向两组比例检验。
题库只有 50 道题,还能做实验吗?
能做探索,不能做判定。50 道题在 ICC=0.6 时有效样本上限约 83,只够检测 20 个百分点以上的大幅变化。这种规模适合定性观察——看答案引用了哪些来源、你的品牌被放在什么位置、描述是否准确,这些不需要统计显著性也有价值。要出因果结论,先把题库扩到 150 题以上。
每题重复几次比较合适?
3–5 次。低于 3 次噪声太大,高于 5 次边际收益迅速衰减——ICC=0.6 时,从 5 次加到 10 次,单题贡献的有效观测只从 1.47 涨到 1.61,涨幅不到 10%,监测成本却翻倍。省下的预算加题目,回报高得多。
四个平台结果不一致怎么判读?
看方向而不是看幅度。四个平台中三个方向一致、且合并后的置信区间下限大于零,可判定有效。如果只有一个平台涨、其余持平或跌,大概率是那个平台当期发生了索引刷新,应延长观测期再读一次,同时检查漂移基线组在该平台的表现。
实验期间平台更新了模型版本,数据还能用吗?
分两种情况。更新发生在读数期之前、且实验组对照组同时受影响,数据仍可用,因为对照组吸收了这部分变化。更新发生在读数期中途,就把读数期切成更新前后两段分别计算,两段方向一致才采信;不一致就作废重跑。这也是必须记录每次采样的具体日期和平台版本的原因。
一次 AEO A/B测试要跑多久?
内容冻结日算起,等待期 14 天 + 读数期 3–7 天,合计 3–4 周。想缩短只有一个合法办法:提前把题库和采集脚本准备好,让等待期和建设期重叠。压缩等待期只会让你读到索引延迟。
提及率和引用率该选哪个当主指标?
选一个,别两个都当主指标(会推高假阳性)。提及率衡量品牌有没有出现在答案文本里,基线通常更高、更容易测出差异,适合大多数实验。引用率衡量你的 URL 有没有被列进来源,更能反映内容主权,但基线更低、需要更大样本。经验做法:主指标用提及率,引用率放护栏指标里跟踪。
