AI品牌可见性评分是把品牌在 AI 答案里的提及、推荐、位置、引用、情感五类观测,按固定权重合成的 0–100 分指标。 它回答一个问题:用户在 DeepSeek、豆包、Kimi、通义千问里问你品类相关问题时,你被写进答案的概率和分量有多大。
难的不是算出这个数,是让它可复核。同一批答案,换一套权重能让分数摆动 16 分;同一个分数,可能对应三种完全相反的病因。本文摊开公式、缺失数据规则、样本量要求和权重敏感性,含三个总分只差 0.7 分、诊断结论却完全不同的脱敏样本。

AI品牌可见性评分是什么?和提及率有什么区别
AI品牌可见性评分是一个 0–100 的合成指标,提及率只是它的一个分项。 提及率回答"有没有被看见",可见性评分回答"被看见之后,是不是被当成答案本身"。前者是二值观测的比例,后者是多个观测按权重折算后的综合值。
区别在决策上很实际。提及率 80% 的品牌可能一分钱转化换不来——它每次都出现在"其他还可以考虑"的第七位;提及率 33% 的品牌可能拿走大部分线索——它出现的那 33% 全是首推。只看单指标会做出相反的预算决定。
提及率本身怎么定义、怎么算,见AI提及率的计算方法与指标体系;指标之间的层级关系(被看见 → 被推荐 → 被采信)在AI品牌可见性怎么衡量里有完整拆解。本文只处理"怎么合成一个数"这一层。
完整评分公式:四个加权项加一个情感调节因子
评分采用"加权和 × 调节因子"结构:
V = 100 × (0.22·M + 0.33·R + 0.17·P + 0.28·C) × Q
四个加权项之和恒为 1,Q 是取值 0.80–1.05 的情感调节乘数。理论上限 105,实际按 100 截断。
四个加权项的口径定义
口径比权重更重要。同样叫"引用率",分母取全部答案还是取"能看到来源列表的答案",结果能差一倍。
| 指标 | 符号 | 口径定义 | 权重 |
|---|---|---|---|
| 提及率 | M | 出现品牌名的有效答案数 ÷ 有效答案总数 | 22% |
| 推荐率 | R | 品牌被明确推荐(首推或进入短名单)的答案数 ÷ 有效答案总数 | 33% |
| 位置分 | P | 仅在"有提及"子集内计算的平均位置权重 | 17% |
| 引用率 | C | 来源列表含品牌可控域名的答案数 ÷ 可观测来源的答案数 | 28% |
| 情感调节 | Q | (正面数 + 0.5×中性数) ÷ 有提及答案数,线性映射到 0.80–1.05 | 乘数 |
位置权重按顺位分四档:
| 品牌在答案中的位置 | 位置权重 |
|---|---|
| 唯一被提及,或首个被提及且带明确推荐语 | 1.00 |
| 在前三顺位之内 | 0.70 |
| 第 4–8 顺位 | 0.40 |
| 第 9 顺位之后,或"其他还有……"式罗列 | 0.15 |
"明确推荐"和"顺带提及"的边界必须写成可执行的判定规则,否则标注一致性会崩。顺位与推荐位的具体判定口径见AI推荐位置怎么统计。
情感为什么做乘数,不做加数
因为负面情感的伤害是全局性的,不是能被其他分项抵消的一项扣分。 如果情感只占 10% 的加权位,一个负面缠身但提及率极高的品牌照样能拿 70 分——这与商业现实相反:AI 答案里反复出现"该品牌此前有质量争议",比不被提及更糟。
做成乘数后,情感健康度对应 Q=0.91 的品牌会被整体打到 0.91 倍,扣掉的分数与它的其他表现成正比。表现越好、负面越致命,符合直觉。这也是本文公式与常见的"位置 40%/频次 25%/引用 25%"类方案的主要结构差异——那类方案普遍把情感"并行追踪但不计入权重",等于把舆情风险从分数里摘了出去。
权重是怎么定的
按"离商业结果的距离"排序,不按"数据好拿的程度"排序:
- 推荐率 33%:最接近成交决策,用户照着 AI 的短名单去搜、去买。
- 引用率 28%:唯一能被自有内容资产直接撬动的杠杆,也是长期护城河。
- 提及率 22%:入场券,边际价值递减——从 20% 涨到 40% 很值钱,从 70% 涨到 90% 几乎不改变转化。
- 位置分 17%:推荐率的细化调节项,与推荐率高度相关,权重必须压低,理由见下节。
位置分和提及率会不会重复计分?
会,如果位置分用无条件口径的话。 把"未提及"记成位置分 0 并计入全体分母,M 和 P 就在测同一件事——两者在我们的脱敏样本里相关系数超过 0.8,加权和等于给"有没有被提到"记了两次分,且这两次分加起来占 39%,直接压过推荐率。
正确做法是把位置分改成条件口径:只在"品牌确实出现了"的答案子集里算平均位置权重。这样 P 回答的是"一旦出现,出现得好不好",与 M 的"出现频率"正交。
代价是 P 的样本量天然小于 M。提及率 20% 的品牌跑 400 次采样,P 只有 80 个样本,置信区间宽得多。所以报告里必须把 P 的有效样本数单独标出来——只报一个 0.48 而不报它由 80 条还是 8 条算出来,等于没报。
缺失数据怎么处理:三类缺失,三种处理方式
缺失数据不能一律剔除,也不能一律记 0,必须先分类。 这是公开评分方案里普遍留白、但对分数影响最大的一环。分类逻辑沿用统计学中缺失机制的经典三分法(完全随机缺失/随机缺失/非随机缺失),落到 AI 答案场景是这样:
| 缺失类型 | 典型场景 | 常见错误做法 | 正确处理 |
|---|---|---|---|
| 结构性缺失 | 平台该次回答不展示来源列表,引用率无法观测 | 记为 C=0 | 从 C 的分母剔除;若该平台整体不可观测,把 0.28 权重按比例摊回其余三项并注明 |
| 随机缺失 | 请求超时、限流、答案被截断 | 直接跳过不记录 | 重跑一次;仍失败则剔除并记录剔除率,剔除率 >10% 时整个周期标记为"低置信" |
| 信息性缺失 | 模型拒答、答非所问、答案只讲品类不提任何品牌 | 当成随机缺失剔除 | 计入分母,记为真实的 0 |
第三类是最贵的错误。假设一个周期里 12% 的答案属于"只讲品类不提任何品牌",把它们剔除,分母从 100 缩到 88,M、R、C 三项同步膨胀 1÷0.88 ≈ 13.6%。一个真实 55 分的品牌会因为这一个操作变成 62 分,虚高 7 分,而且所有竞品同步虚高,横向对比看不出异常——只有跟自己的历史数据对比时才会突然"集体上涨"。
判断某个周期是否被这样处理过,最快的办法是看"无品牌答案率"这个字段有没有被单独报出来。它没有出现在报告里,通常意味着它被静默剔除了。原始答案的留档规范见AI回答原文怎么留档——没有原文留档,任何缺失分类都无法复核。
样本量要多少:置信区间、重复采样与有效样本
跑 30 条问句得到的提及率,误差范围接近 ±16 个百分点,不能用于判断周环比。 下表是提及率真值 30% 时,按 Wilson 得分区间法算出的 95% 置信区间(该方法在小样本和极端比例下比正态近似稳健):
| 有效样本数 n | 95% 置信区间 | 半宽 |
|---|---|---|
| 30 | 16.7% – 47.9% | ±15.6pp |
| 50 | 19.1% – 43.8% | ±12.3pp |
| 100 | 21.9% – 39.6% | ±8.8pp |
| 200 | 24.1% – 36.7% | ±6.3pp |
| 400 | 25.7% – 34.7% | ±4.5pp |
| 800 | 26.9% – 33.3% | ±3.2pp |
这解释了一个常见困惑:为什么提及率从 30% 跳到 36% 之后,什么优化都没做又跌回 31%。在 n=100 时,30% 和 36% 的置信区间几乎完全重叠,这个"涨幅"从统计上根本不存在。
要检测出真实变化,需要多少样本
上表是单点估计的精度,判断"这一期比上一期真的涨了"需要更大的量。按两样本比例检验(α=0.05,功效 80%)估算:
- 稳定检出 10 个百分点的变化(30% → 40%),每期约需 350 次有效采样。
- 稳定检出 5 个百分点的变化(30% → 35%),每期约需 1370 次有效采样。
结论很直接:周报不适合汇报 5pp 级别的变化,月报才有资格。 想把周报做成有结论而不是有波形,参考AI品牌周报怎么写——把置信度写进结论,比多画两张折线图有用。
重复采样不等于独立样本
生成模型有随机性,同一个问句跑三次结果可能不同,所以要重复采样。但重复采样得到的不是三个独立样本。同一问句内部的答案高度相关,需要按设计效应折算有效样本量:
DEFF = 1 + (k − 1) × ρ
有效样本 n_eff = 总采样次数 ÷ DEFF
k 是每个问句的重复次数,ρ 是同问句内相关系数。在我们的脱敏样本里,ρ 大致落在 0.55–0.65 区间。取 ρ=0.6、k=3,DEFF = 2.2:
50 个问句 × 3 次重复 = 150 次采样,有效样本只有约 68 次,置信半宽 ±10.6pp,而不是按 150 算出来的 ±7.3pp。
扩问句比扩重复次数划算得多。 同样把采样量翻三倍:从 50 问句 ×1 次扩到 150 问句 ×1 次,有效样本就是 150;扩成 50 问句 ×3 次,有效样本只有 68。
重复次数取几次
重复次数的作用是压住单次生成的随机抖动,不是提高精度。实操建议:
- k=3 是默认值,能识别出"同一问句答案不稳定"的品牌,DEFF=2.2 的代价可接受。
- k=1 适合问句预算紧张时,把全部预算换成问句覆盖面,但会失去"答案稳定性"这个观测。
- k≥5 收益极低,DEFF 涨到 3.4,第 5 次采样贡献的有效样本不足 0.3 次。
权重敏感性:换一套权重,排名会不会翻
会,而且翻得比大多数人预期的厉害。 下面是三个脱敏样本的分项数据。样本来自 MaxAEO 监测账户,每个品牌 60 条问句 × 4 个平台(DeepSeek、豆包、Kimi、通义千问)× 3 次重复,单周期约 720 次采样,按 ρ=0.6 折算后有效样本约 327 次,提及率的置信半宽约 ±4.9pp。品牌名与具体品类已脱敏。
| 分项 | 品牌 A(家电) | 品牌 B(B2B SaaS) | 品牌 C(新消费) |
|---|---|---|---|
| 提及率 M | 0.82 | 0.33 | 0.84 |
| 推荐率 R | 0.35 | 0.58 | 0.66 |
| 位置分 P(条件口径) | 0.48 | 0.83 | 0.68 |
| 引用率 C | 0.62 | 0.50 | 0.28 |
| 情感因子 Q | 1.01 | 1.03 | 0.93 |
| 基线总分 V | 55.7 | 56.2 | 55.5 |
三个品牌的分数只差 0.7 分。现在换权重:
| 权重方案(M/R/P/C) | 品牌 A | 品牌 B | 品牌 C | 排序 |
|---|---|---|---|---|
| 基线 22/33/17/28 | 55.7 | 56.2 | 55.5 | B > A > C |
| 提及优先 35/25/25/15 | 59.3 | 55.9 | 62.4 | C > A > B |
| 引用优先 15/25/10/50 | 57.4 | 54.3 | 46.4 | A > B > C |
品牌 C 在三套权重下从 62.4 分跌到 46.4 分,摆动 16.0 分——是三个品牌基线差距(0.7 分)的 23 倍。 三套方案给出三种排序,没有一次相同。
摆动幅度可以事先算出来
权重变动带来的分数变化有闭式解,不需要重跑数据:
ΔV = 100 × Q × Σ(Δwᵢ × xᵢ)
以品牌 C 从基线切到"引用优先"为例:C 权重 +0.22、M −0.07、P −0.07、R −0.08,代入各分项值得 0.22×0.28 − 0.07×0.84 − 0.07×0.68 − 0.08×0.66 = −0.0976,乘 100 再乘 Q=0.93,得 −9.1 分,与实测 55.5 → 46.4 吻合。
由此得到一条可操作的规则:分项之间的分值差越大,评分对权重越敏感。 品牌 C 的分项从 0.28 铺到 0.84,跨度 0.56,任何权重调整都会剧烈搅动它的总分;品牌 B 的分项相对集中,摆动只有 1.9 分。
由此推出的三条使用纪律
- 分差小于 8 分的品牌视为同一档,不做排名解读。8 分大约是把 0.25 的权重在跨度 0.3 的两个分项间对调所产生的摆动量,属于方法噪声而非实力差距。
- 跨供应商的绝对分不可比。 不同工具的权重、问句集、判定规则、缺失数据处理全不一样,两个 62 分不是同一个 62 分。
- 绝对分只能纵向自比,横向比较改用同一套权重下的相对份额指标。
采购阶段怎么验证一家供应商的权重和口径是否可复核,AI搜索监控工具怎么选里有对照清单——重点问三件事:权重是否公开、位置判定规则是否可导出、无品牌答案率是否单列。
相同分数,完全不同的问题:三个样本的诊断
上表三个品牌总分几乎相同,病因和处方完全不重叠。这是"只看总分不看分项"最大的代价。

品牌 A:认知很广,但进不了短名单
M=0.82 说明 AI 认识它,R=0.35 说明认识不等于推荐,P=0.48 说明它长期待在名单中后段。典型症状是"用户问品类,答案里有你;用户问怎么选,答案里推别人"。
病因通常是缺少决策阶段的结构化证据:没有可被模型抽取的参数对比、适用场景边界、选型条件。处方是补对比型内容和参数表,把"什么情况下应该选我们"写成模型能直接引用的句子,而不是宣传语。
品牌 B:一旦出现就赢,但出现得太少
M=0.33 是三个里最低的,但 R=0.58、P=0.83 都是最高——它在自己覆盖到的问句里几乎都是首推。问题不在内容质量,在覆盖面:问句集合太窄,大量相关场景根本没触达。
处方是扩问句、扩场景,不是改现有内容。 从核心产品词扩展到用户完整问句、上下游场景词、替代方案对比问法。B2B 场景的问句结构(供应商初筛、技术评估、采购尽调三段)在B2B企业怎么做GEO里有拆解。
品牌 C:声量很响,但引用空心且情感失血
M=0.84、R=0.66 都很漂亮,C=0.28 却是三个里最低,Q=0.93 说明负面占比明显偏高。它的可见性完全建立在第三方种草内容上,自有域名几乎没有被 AI 当作来源采信。
这是最脆弱的一种 55 分:声量靠外部渠道,一旦第三方内容衰减或口碑翻车,分数会断崖式下跌,品牌自己没有抓手。 处方两条并行——建立自有证据链(可被引用的官方数据页、检测报告、产品文档),同时处置负面来源。整体方法论见AI搜索优化是什么。
落地:把评分做成可复核的月度流程
分数的价值取决于能不能被第三方复核一遍并得到同样的数。 每个周期必须留痕这七项:
- 问句集合版本号:问句变了分数必然变,改问句和改内容不能在同一周期做。
- 平台与版本快照:平台名、访问时间、是否开启联网检索,逐条记录。
- 原始答案全文留档:截图加文本双份,用于复核判定争议。
- 判定规则文档:什么算"明确推荐"、什么算"顺带提及",写成带正反例的规则,标注一致性低于 85% 就重新对齐。
- 缺失分类计数:三类缺失各多少条,无品牌答案率单独列出。
- 有效样本量与置信半宽:报分数必须同时报 n_eff 和误差范围。
- 权重方案与变更记录:权重一旦改动,历史数据必须用新权重重算一遍,否则时间序列断裂。
第一次建体系不必直接上全量。先用 7 天小规模验证数据本身是否可信,方法见AI搜索监测POC怎么做;确认可信之后再扩问句、拉长周期。
第一个月的最小可行版本
预算有限时,按这个顺序砍,先保住可复核性:
| 项目 | 最小版本 | 完整版本 |
|---|---|---|
| 问句数 | 30 条核心问句 | 60–120 条覆盖全漏斗 |
| 平台数 | 2 个(主力 + 竞品最强的那个) | 4 个 |
| 重复次数 | k=1 | k=3 |
| 频率 | 月度 | 周度采集、月度解读 |
| 必留痕项 | 第 1、3、5、6 项 | 全部七项 |
最小版本的有效样本约 60 次,只够判断 15pp 以上的变化。它的用途是建立基线和验证流程,不是用来汇报增长。
常见问题
AI品牌可见性评分多少分算及格?
没有跨品牌通用的及格线,因为分数由问句集合决定。窄品类里 70 分可能只意味着覆盖了三个问法,宽品类里 45 分可能已经是头部。有意义的参照只有两个:自己的历史分数,以及同一套问句集合下直接竞品的分数。脱离问句集合谈"行业平均分"不成立。
分数每周都在波动,怎么判断是真变化还是噪声?
看置信区间是否重叠。提及率真值 30%、有效样本 100 时,半宽约 ±8.8pp,30% 和 36% 之间的差异无法区分。稳定检出 10pp 变化每期约需 350 次有效采样,5pp 约需 1370 次。样本量不够时,正确做法是拉长统计周期,而不是给波形编解释。
可以直接用某个工具的分数去和竞品的公开分数比吗?
不能。不同工具的权重、问句集、位置判定规则、缺失数据处理方式都不同,本文的敏感性测试显示仅权重一项就能造成 16 分的摆动。要比就用同一个工具、同一套问句、同一个周期同时跑双方。
情感做乘数会不会导致过度惩罚?
调节区间限制在 0.80–1.05,最大扣减 20%,最大加成 5%——上限收得比下限紧,是刻意的不对称设计:口碑好只是应该,口碑差是风险。若某品类天然争议性高(如金融、医美),可以把区间收窄到 0.88–1.03,但必须全品类统一,不能只给自己放宽。
只监测一个平台可以算这个分数吗?
可以算,但报告里要明确标为单平台分,不要叫"AI可见度"。各平台的检索机制、来源偏好、答案长度差异很大,同一品牌在 DeepSeek 和豆包上的引用率可能差一倍。想先快速自检再决定投入,用DeepSeek、豆包、Kimi 的品牌自测清单手动跑一轮。
改了内容多久能看到分数变化?
按平台的检索机制分两种:接了实时联网检索的平台(如带搜索的 DeepSeek、豆包),内容被索引后 1–4 周可能反映到引用率;纯依赖训练数据的回答模式,变化周期以模型版本迭代为准,可能是数月。所以评估内容改动效果时,引用率 C 先动、提及率 M 后动,看 M 没变就判定失败,通常是看早了。
多个品牌线或子品牌要不要分开算分?
分开算。子品牌的问句集合、竞品集合、情感来源都不同,合并计算会让强势子品牌的高分掩盖弱势线的问题。母品牌层面可以做加权汇总,但权重要按业务口径(营收占比或战略优先级)定,并在报告里写明汇总方式。
