做AI品牌可见性评估时,绝大多数团队只回答了一个问题:品牌有没有出现在答案里。但"出现"和"被选中"之间隔着一整条决策链。我们在 8 周跨平台监测中发现,12 个受监测品牌的平均提及率是 38.1%,而真正进入推荐名单的比例只有 14.7%——中间蒸发掉的 61.4%,正是绝大多数指标看板看不见的地方。
本文给出四级指标口径、语义角色的打标规则、以及"多大的波动才算真变化"的噪声基线——最后一项是现有框架几乎都没回答、却决定你的看板有没有用的问题。
什么是AI品牌可见性评估?
**AI品牌可见性评估是用固定问句集反复向AI助手提问,统计品牌在答案中的出现频率、语义位置、引用依据与竞品占比的测量方法。**它衡量的不是网页排名,而是品牌在生成式答案里被选中的概率与分量。
和传统SEO排名监测的区别在于三点:
- 答案是生成的而非检索的,同一问句两次提问结果可能不同,所以任何单次结果都不构成数据点。
- 没有第 10 位以后,一个答案通常只容得下 3–6 个品牌,进不了名单等于零曝光,没有"排在第 15 位慢慢优化"这种中间态。
- 位置的语义权重远大于顺序权重,出现在"推荐"句里和出现在"其他还有"句里,商业价值差一个数量级。
这三点直接决定了方法论:评估的最小单位是"分布"而不是"一次结果",因此每个指标都必须附带采样量和波动区间,否则数字无法解读。

为什么"被提到"不等于"被推荐"
这是整套框架的起点。我们把"品牌名出现在答案文本中"记为提及,把"品牌出现在明确的推荐、首选、建议优先考虑等语义结构中"记为推荐位。两者的比值我们称为提及转推荐率(Mention-to-Recommendation,M2R)。
监测方法:4 个AI平台(DeepSeek、豆包、Kimi、通义千问)、3 个品类各 60 条品类问句(共 180 条)、每条问句每平台每周独立新会话提问 3 次、连续 8 周,共 17,280 次有效采样,覆盖 12 个品牌。
| 品类 | 品牌数 | 平均AI提及率 | 推荐位占有率 | M2R |
|---|---|---|---|---|
| 消费电子 | 3 | 51.2% | 12.4% | 24.2% |
| SaaS 工具 | 5 | 31.7% | 15.8% | 49.8% |
| 家清个护 | 4 | 36.4% | 14.9% | 40.9% |
| 合计 | 12 | 38.1% | 14.7% | 38.6% |
消费电子的提及率最高、M2R 最低。原因在采样记录里很清楚:这类问句的答案高频出现"市面上还有 A、B、C 等品牌可以了解"这种枚举收尾句,品牌进的是清单尾巴,不是建议本身。
只看提及率,这三个品牌会被评为表现最好的一组,而它们恰恰是转化最差的一组。
AI品牌可见性评估的四级指标树
四级指标树按"存在 → 位置 → 证据 → 竞争"分层,每一级只回答一个问题,且下一级以上一级为分母,保证指标可以逐层归因、不互相污染。各指标的定义演进可参考从提及率到推荐位的指标体系。
| 层级 | 核心指标 | 计算口径 | 回答的问题 |
|---|---|---|---|
| L1 存在层 | AI提及率 | 含品牌名的答案数 ÷ 总采样答案数 | 模型知不知道我 |
| L2 位置层 | 推荐位占有率 | 品牌进入推荐语义结构的答案数 ÷ 总采样答案数 | 我是被建议还是被顺带一提 |
| L3 证据层 | 引用来源命中率 | 引用源含品牌相关域名的答案数 ÷ 提及品牌的答案数 | 模型说我时,依据是什么 |
| L4 竞争层 | AI搜索声量份额 | 品牌被点名次数 ÷ 该问句集内所有品牌被点名总次数 | 这个品类里谁在赢 |
L1 存在层:AI提及率是及格线,不是成绩
AI提及率衡量品牌是否进入了模型的候选集合,是唯一一个"低了就没有后续"的指标。
但它有明显天花板效应:一旦超过 60%,继续投入拉高提及率的边际收益极低,因为剩下的空白问句往往是意图根本不匹配的长尾。我们的样本里,提及率从 60% 拉到 70% 的两个品牌,推荐位占有率一个没动、一个反而下滑——新增的提及全部落在枚举句里。计算细节和常见口径陷阱可见AI提及率的计算方法与指标体系。
L2 位置层:推荐位、候选位与顺带提及要分开记
这一级的关键是不要用"出现顺序"代替"语义角色"。在 17,280 次采样中,按顺序取前三名的判定方法,与按语义角色判定的结果不一致率高达 31.7%——顺序靠前但只是背景板的情况非常普遍,尤其在"先讲行业现状再给建议"这种答案结构里。
L3 证据层:引用来源决定推荐能不能稳定复现
L3 回答"模型说我的时候,依据来自哪里"。它是四级里唯一能预测下周还会不会被推荐的指标。
分母取 L1(提及品牌的答案数)而非总采样,因为没被提及就谈不上引用。记录时要拆成两类:
- 自有域命中:官网、官方文档、官方商城、品牌自建知识库
- 第三方域命中:评测媒体、垂类榜单、问答社区、电商评价页、行业白皮书
实测中带可见引用源的答案占 43.6%,平台差异极大:DeepSeek 联网模式 68.2%、豆包 41.5%、Kimi 39.8%、通义千问 24.9%。在这些带引用的答案里,按下周同问句是否仍占推荐位统计:
| 引用命中类型 | 下周仍占推荐位的比例 |
|---|---|
| 命中第三方域 | 71.4% |
| 仅命中自有域 | 48.9% |
| 无引用命中 | 33.2% |
**结论:第三方证据比自有内容更能稳住推荐位。**只堆官网内容的品牌,推荐位波动最大——被推上去容易,掉下来也快。这也是 L3 值得单列的原因:在我们的案例里,引用命中率的上涨领先推荐位约 2 周,它是 L2 的先行指标,而不是 L2 的补充说明。
L4 竞争层:份额口径比绝对率更抗噪
绝对提及率会被"名单长度"污染。实测中每个答案平均点名的品牌数量差异很大:豆包 5.8 个、Kimi 4.6 个、通义千问 3.9 个、DeepSeek 3.1 个。
**在豆包上拿到 50% 提及率,含金量低于在 DeepSeek 上拿到 40%。**份额口径把名单长度约掉,因此跨平台汇总必须先在平台内归一化再加权。
情感不是第五级,而是符号位
负面情感的提及应当在各级指标上取负值参与汇总,否则一次危机事件会让看板显示"可见度大涨"。我们的样本里出现过一次:某品牌因被反复列为"避坑案例",单周提及率跳涨 11 pp,未做符号处理的看板把它记成了历史最好成绩。
怎么判定语义角色:一套可复算的打标规则
语义角色是整套框架里最容易失真的一环——两个人凭感觉标,同一份样本能标出两套结论。我们用的判定信号如下:
| 语义角色 | 触发信号(答案中的句式) | 计权 |
|---|---|---|
| 推荐位 | "推荐/首选/建议优先考虑/最适合 X 的是",且品牌是该句主语 | 1.0 |
| 候选位 | 出现在"可以考虑 A、B、C"的并列结构中,无优先级排序 | 0.4 |
| 顺带提及 | 出现在举例、对比背景、行业概述、反面案例中 | 0.1 |
三条判定优先级规则,缺一就会出现口径分歧:
- 同一答案中多次出现,取最高角色,不重复计数。
- 否定语境一律记负("不建议""不适合预算有限的用户"),不因为出现了"建议"二字就判为推荐位。
- 必须回填原句片段作为证据字段,不允许只标结论。
第 3 条是实测中收益最大的一条。两名标注员独立标注 500 条样本,Cohen’s kappa 一致性系数为 0.79,分歧几乎全部集中在推荐位与候选位的边界;强制回填原句后,kappa 升到 0.88。没有证据字段的打标数据不可复算,也就不可用于汇报。
一手实测:什么幅度的波动才算真变化
这是现有指标框架几乎都没回答的问题。我们从 12 个品牌中选出 4 个在监测期内确认无任何投放、公关和内容动作的品牌作为对照组,测量各指标在"什么都不做"时的周环比波动。基线按"单品牌跨 4 平台单周 720 次采样"的汇总周值计算。
| 指标 | 周环比变化标准差 σ | 最小可检测变化 MDC(95%) |
|---|---|---|
| AI提及率 | 4.1 pp | 8.0 pp |
| 推荐位占有率 | 5.7 pp | 11.2 pp |
| 引用来源命中率 | 2.3 pp | 4.5 pp |
| AI搜索声量份额 | 3.2 pp | 6.3 pp |
MDC 取 1.96σ。结论很直接:推荐位占有率涨了 6 个百分点,在这个采样规模下不能称为提升,它落在噪声区间内。
在 n=720、p≈0.4 时,纯二项采样带来的周环比波动理论值约为 2.6 pp,而实测提及率的 σ 是 4.1 pp。多出来的部分不是采样误差,是模型本身的答案漂移——这意味着加大采样量能压缩误差,但压不到理论下界,任何"再多问几次就能看清"的期待都有上限。
平台间差异同样显著:豆包的提及率波动最大(σ=6.8 pp),通义千问最稳(σ=2.9 pp),跨平台汇总时必须分别设阈值。
案例:一个中端家电品牌 6 周把 M2R 翻倍
起始数据:提及率 44.3%、推荐位占有率 9.1%、引用来源命中率 6.7%、M2R 20.5%。
诊断结论:它几乎全部出现在枚举收尾句里,且缺少可被引用的参数化对比内容——典型的"L1 及格、L2 塌陷"。第 1–6 周执行三件事:建结构化对比页、把真实用户评价沉淀到问答与社区、补专家背书内容。第 8 周复测(留 2 周给收录与索引滞后):
- 提及率 47.9%(+3.6 pp,低于 8.0 pp 阈值,不判定为显著)
- 推荐位占有率 21.4%(+12.3 pp,超过 11.2 pp 阈值,显著)
- 引用来源命中率 15.2%(+8.5 pp,超过 4.5 pp 阈值,显著)
- M2R 从 20.5% 升至 44.7%
**提及率几乎没动,推荐位翻了一倍多。**这组数据证明两级指标可以独立变动,也说明只盯 L1 的团队会把一次成功的优化误判为无效。

样本量要多少才够?
用二项比例置信区间反推即可。以观测比例 p≈0.4、95% 置信度计算,误差半宽随样本量的变化如下(Wilson 与正态近似在此区间结果接近,方法说明见二项比例置信区间):
| 单周有效采样数 n | 误差半宽(±) |
|---|---|
| 30 | 17.5 pp |
| 60 | 12.4 pp |
| 120 | 8.8 pp |
| 240 | 6.2 pp |
| 480 | 4.4 pp |
实践建议:单平台单周有效采样不低于 120 次,否则任何小于 9 个百分点的变化都无法解释。想做周度决策的团队,建议做到 240 次以上。
注意误差半宽衡量的是"这一周的数值有多准",MDC 衡量的是"两周之间的差有多大才算数",后者约等于前者的 1.4 倍(两次独立测量的方差叠加)。看板上只放置信区间、不放 MDC,仍然会让人把噪声读成趋势。
落地这套评估的 7 个步骤
- 建问句集:按品类词、场景词、对比词、替代词、痛点词五类各配 10–15 条,覆盖用户真实问法而非关键词。
- 固定采样协议:每次提问开新会话、关闭个性化与历史记忆、固定时间窗,避免上下文污染,具体规则见监测品牌推荐时要不要每次开新对话。
- 打标签:每次提及标注语义角色、情感极性、是否带引用源,并强制回填原句证据字段。
- 算四级指标:按上表口径逐级计算,L3 以 L1 为分母,其余以总采样为分母。
- 测噪声基线:连续 4 周记录无动作状态下的波动,算出你自己的 MDC,不要直接套用本文数值——你的问句集、品类竞争密度和平台组合都不同。
- 设显著性阈值:变化小于 MDC 一律标记为"未确认",不进入汇报,也不触发复盘会。
- 归因到原因:只有确认显著的变化才值得追查动因,方法见把AI推荐结果归因到原因的诊断体系。
自建监测还是买工具:五个必问的问题
市面上的AI可见性工具口径差异极大,同一品牌同一周的数字能差出 20 个百分点。选型时问清这五点,比看功能列表有用:
- **每个数据点采样几次?**低于 3 次的直接排除,单次结果的信息量接近于零。
- **是否每次开新会话、是否关闭个性化?**做不到会话隔离的数据不可比。
- **推荐位怎么判定——关键词匹配还是语义判定?给不给原句证据?**只给数字不给原句的,无法验证也无法复算。
- **平台覆盖走 API 还是网页端?**同一模型的 API 与网页端答案不同源(联网检索、系统提示词、安全策略都不同),混用会引入系统性偏差。
- **有没有噪声基线和显著性标记?**没有的话,你买到的是一条波动曲线,不是一个决策依据。
不同工具的数字不要横向对比,只在同一工具内看趋势。
四个最常见的评估错误
用单次提问下结论。 同一问句在同一平台连续问 3 次,品牌名单完全一致的比例在我们的采样中只有 57.3%。单次结果的信息量接近于零。
跨平台直接加总。 各平台的名单长度、语气偏好、引用习惯差异巨大,直接平均会让波动最大的平台主导整体数字。正确做法是先在平台内做份额口径归一化,再按业务权重加权。
没有对照就宣布因果。 你的提及率涨了 6 pp,同期整个品类的答案篇幅也在变长——这时候涨的是品类红利不是你的功劳。用 L4 份额口径复核一遍,份额没涨就说明你只是跟着水位上浮。
忽略模型版本断点。 大版本更新会让历史数据的可比性直接失效,必须在时间轴上打断点并重建基线,处理方法见模型大版本更新后的品牌可见性重估。
常见问题
AI品牌可见性评估应该多久做一次?
建议周度采样、月度汇报。周度采样保证样本量累积和异常及时发现,月度汇报避开噪声区间——单周变化超过 MDC 的概率本身就不高,按周汇报容易制造虚假波动叙事。
提及率涨了但业务没动,说明指标没用吗?
更可能是你停在了 L1。提及率提升如果没有同步带来推荐位占有率提升,说明品牌只是进了候选清单尾部。先看 M2R 有没有变化,再判断指标有没有用。
多少个问句才算一个合格的问句集?
50–60 条是单品类的实用下限,需覆盖品类词、场景词、对比词、替代词、痛点词五类意图。问句数量不足时,指标会被少数几个高波动问句主导,看板会随机跳动。
竞品数据从哪里来?
不需要额外采集。同一批答案里出现的所有品牌名都应记录,竞品指标和自己的指标来自同一份样本,这也是份额口径能成立的前提——分子分母同源,才没有口径差。
情感为什么不单独作为一级指标?
因为情感没有独立的量纲,它修饰的是每一次提及的价值方向。单列会导致"负面提及也算可见度"的口径错误,正确做法是把它作为符号位乘进各级指标。
做一轮完整评估的成本主要在哪里?
不在调用。单品类 60 问句 × 4 平台 × 3 次 × 4 周 = 2,880 次/月,模型调用成本很低。主要开销是人工标注——按我们的记录,500 条样本的语义角色标注约需 3–4 人时,这也是"能不能长期跑下去"的真正瓶颈。先把打标规则固化成可复用的判定表,成本才降得下来。
这些指标能对上业务吗?
12 个品牌里有 5 个能拿到品牌词搜索量数据。推荐位占有率的周变化,与 4 周后品牌词搜索量变化的相关性为 r=0.62;提及率与其相关性只有 r=0.18。样本量太小(n=5),只当方向参考,不作因果结论——但方向很明确:该盯的是 L2,不是 L1。
