AI搜索声量份额(AI Share of Voice)是指在一组固定问题、固定 AI 平台的采样中,你的品牌出现次数占「你 + 所有对标竞品」出现总次数的比例。 它有两套主流算法:一套只数提及次数,一套按问题的商业价值加权。两套算出来的不是小数点后的差别——我们用 1200 次采样实测,同一批品牌在两套口径下的名次最多挪了 3 位,第一名掉到了第四。
这篇文章拆开两套算法的公式、实测差异、样本量门槛、不同工具口径为何对不上,以及一份可以直接端上管理层会议的竞品声量报表。
什么是 AI 搜索声量份额?
AI搜索声量份额指在固定问题集和固定平台上采样时,某品牌被提及的次数占所有对标品牌被提及总次数的百分比。它衡量的是相对占位,不是绝对曝光量。
它和传统的搜索声量份额有一个根本差别:传统 SOV 有两个可观测量——排第几条、被展示多少次,Search Console 直接给。AI 答案里两个都没有。同一个问题问两次,答案措辞不同、品牌顺序不同、有时干脆不提品牌。Google 的 AI Mode 更是既没有排名位次,也不在 Search Console 里单独拆分数据,AI Mode 可见性只能靠主动采样测量。
所以 AI 搜索声量份额只能靠主动采样构造出来:你自己定义问题集、自己定义平台、自己重复提问、自己统计。这意味着口径本身就是方法论的一部分——换一套问题集,份额数字就变了。
顺带一提,为什么份额比"排第几"更重要:Pew Research Center 追踪 900 名美国成年人的浏览行为发现,页面出现 AI 摘要时用户点击搜索结果的比例是 8%,没有摘要时是 15%。当点击本身在消失,"答案里有没有你"就取代了"排第几"。

提及计数法怎么算:最简单的口径和它的三个盲区
提及计数法(Mention-count SOV)只做一件事:数品牌在答案里出现了多少次,再除以所有对标品牌的出现总次数。
提及份额(品牌) = 该品牌被提及的次数 ÷ Σ(全部对标品牌被提及次数) × 100%
举例:1200 个答案里共产生 3180 次品牌提及,你的品牌占 754 次,提及份额就是 754 ÷ 3180 = 23.7%。
它的优点是可以全自动跑,不需要人工标注,适合做日更监控和异常告警。它的问题在于把三种完全不同的东西算成了同一个分:
- 形态盲区:一句"首选 A,覆盖最全"和一句"预算实在有限可以看看 A",在计数里都是 1 次。
- 价值盲区:"什么是 CDP"这种零购买意图的科普问句,和"我们该选哪家 CDP"这种临门一脚的决策问句,权重相同。
- 平台盲区:四个平台等权平均,掩盖了"你在豆包上被反复推荐、在 Kimi 上几乎不存在"这种结构性问题。
这三个盲区不是理论推演。下面是实测的偏差幅度。
1200 次采样实测:两套口径让同一批品牌排名差 3 位
我们在 2026 年 6 月对一个中国市场的 B2B SaaS 品类(客户数据平台 / CDP)做了一轮完整采样,目的就是量化"数提及"和"按价值加权"到底能差出多少。
| 测试项 | 设置 |
|---|---|
| 品类 | 中国市场 B2B SaaS(客户数据平台) |
| 对标品牌 | 5 个,匿名为品牌 A–E |
| 问题集 | 60 个中文问句,覆盖认知 / 评估 / 决策三类意图,全部为非品牌词问句 |
| 平台 | DeepSeek、豆包、Kimi、通义千问 |
| 重复采样 | 每题每平台 5 次,均为新会话、关闭个性化记忆 |
| 总采样量 | 60 × 4 × 5 = 1200 个答案 |
| 时间窗口 | 2026 年 6 月 2 日 – 6 月 29 日,每周一轮 |
| 提及判定 | 人工复核,分为推荐位 / 候选位 / 普通提及三档 |
1200 个答案共产生 3180 次品牌提及,平均每个答案点名 2.65 个品牌。两套口径的结果如下:
| 品牌 | 提及次数 | 提及计数份额 | 名次 | 商业价值加权份额 | 名次 | 名次变化 |
|---|---|---|---|---|---|---|
| 品牌 A | 754 | 23.7% | 2 | 24.8% | 1 | ↑1 |
| 品牌 B | 871 | 27.4% | 1 | 18.9% | 4 | ↓3 |
| 品牌 C | 616 | 19.4% | 3 | 19.7% | 3 | — |
| 品牌 D | 452 | 14.2% | 5 | 21.6% | 2 | ↑3 |
| 品牌 E | 487 | 15.3% | 4 | 15.0% | 5 | ↓1 |
五个品牌里有两个的名次挪动了 3 位。 拆开看原因:
- 品牌 B 是"科普型声量"。它 61% 的提及来自"什么是 CDP""CDP 和 CRM 有什么区别"这类认知类问句,推荐位占比只有 19%。它在 AI 里很出名,但出名的位置离成交很远。
- 品牌 D 是"决策型声量"。它 57% 的提及集中在"CDP 怎么选""XX 的替代品有哪些"这类决策类问句上,推荐位占比高达 48%。裸提及排最后一名,实际却在真正掏钱的问题上占住了位置。
- 全样本推荐位占比只有 34%。也就是说,被提及的品牌里,三分之二的出现只是"被顺带列了一下",而提及计数法把这三分之二算成了满分。
- 同一品牌跨平台的份额极差中位数是 11.4 个百分点,最大 19.3 个百分点(品牌 E 在豆包上 24.6%,在 Kimi 上只有 5.3%)。等权平均把这个信号抹平了。至于平台之间为什么会差这么多,八个 AI 引擎为什么给出八个不同答案里有更细的成因拆解。
- 4.2% 的提及带有明确负面限定("功能偏轻""不适合大数据量"),裸计数会把它们算成正向份额。
结论很直接:提及计数份额适合做趋势监控,不适合做资源分配决策。 拿它去汇报,你可能正在给一个"科普型声量"品牌发奖金。
商业价值加权法怎么算:把「这个问题值多少钱」写进公式
商业价值加权份额(下文简称 CV-SOV)在计数的基础上乘三个系数:问题的商业价值 V、平台的受众权重 W、出现形态的质量分 Q。
CV-SOV(品牌b) = Σ(V(q) × W(p) × Q(b,q,p)) ÷ Σ_全部品牌 Σ(V(q) × W(p) × Q(b',q,p)) × 100%
其中 q 是问题,p 是平台。落地分四步:
- 给每个问题打商业价值分 V。V = 意图分 I × 频次分 F。意图分建议三档:决策 / 交易类给 5("A 和 B 哪个好""XX 的替代品""XX 多少钱"),评估类给 3("XX 怎么选""XX 要注意什么"),认知类给 1("什么是 XX")。频次分 F 归一化到 0.5–1.5,来源优先用真实数据——客服工单、销售 CRM 的常见异议、站内搜索词,而不是拍脑袋。
- 给每次出现打形态质量分 Q。推荐位 1.0(明确建议、首位列举、给出选择理由),候选位 0.6(并列清单中的一员),普通提及 0.3(背景性带过),负面限定提及 -0.5(且必须单列一栏,不要直接并进总分)。
- 给每个平台打受众权重 W。W 不是平台的市场份额,是你的目标客户在该平台的实际使用占比,归一化到总和为 1。数据来源可以是自有渠道调研、官网 referral 分布或销售访谈。B2B 品牌和消费品牌的权重表通常完全不一样,哪些 AI 引擎对你的买家真正重要给出了筛选逻辑。
- 逐条相乘再汇总。分子是你自己的加权分总和,分母是所有对标品牌的加权分总和。
一个手算示例:认知类提及只值决策类推荐位的 1/11
假设 DeepSeek 的平台权重 W = 0.35,品牌 D 在三个问题上的表现如下:
| 问题 | 意图分 I | 频次分 F | V = I×F | 出现形态 | Q | 贡献 V×W×Q |
|---|---|---|---|---|---|---|
| 什么是 CDP | 1 | 1.2 | 1.2 | 普通提及 | 0.3 | 0.126 |
| CDP 怎么选 | 3 | 1.0 | 3.0 | 候选位 | 0.6 | 0.630 |
| XX 的替代品有哪些 | 5 | 0.8 | 4.0 | 推荐位 | 1.0 | 1.400 |
品牌 D 在这三题上的分子贡献是 2.156。注意第一行和第三行的比值:在科普问句里被顺带提一嘴,价值只有在替代品问句里被明确推荐的 1/11。 这就是 B 和 D 名次互换的全部数学原因。
把这套算法跑一遍你自己的品类,通常会发现两件事:一是你以为的领先优势在决策类问句里并不存在;二是某个被你忽略的小竞品,正在你最贵的那批问题上占推荐位。

两套口径怎么选:对比表
| 维度 | 提及计数份额 | 商业价值加权份额 |
|---|---|---|
| 计算成本 | 低,可全自动 | 中,需人工定义权重表并抽检形态标注 |
| 数据要求 | 只需判断品牌是否出现 | 需形态标注 + 问题分级 + 平台权重 |
| 数字稳定性 | 较高,但对问题集构成极敏感 | 较低,权重表一改就不可比 |
| 能否解释因果 | 弱,只知道涨跌不知道原因 | 强,可下钻到具体问题簇 |
| 适用场景 | 周度监控、异常告警、大盘趋势 | 月度 / 季度管理层复盘、预算分配、竞品对标 |
| 主要风险 | 认知类问题灌水,虚高 | 权重主观,容易被"调参调出好看数字" |
实操建议:两套同时算,一套用来发现异常,一套用来解释异常。 只跑一套,要么看不见问题,要么解释不了问题。
采样怎么设计:问题集、平台、会话状态三件事
公式再准,采样设计错了就全废。三条硬要求:
1)问题集里非品牌词问句 ≥ 80%。 问"MaxAEO 怎么样"当然会提到你。份额的竞争意义只存在于"用户还不知道该选谁"的问句里。建议配比:认知类 25%、评估类 40%、决策类 35%——决策类不能太少,那是加权分母里最重的部分。
2)每次提问都开新会话,关闭个性化记忆。 ChatGPT 的记忆功能、Kimi 的历史上下文都会让前一轮的品牌名污染下一轮答案。我们在测试初期没关记忆,同一品牌的提及次数比干净会话高出约 20%——这是纯粹的自我污染。
3)同一问题在不同平台要逐字一致。 换一个字,问题就不是同一个问题了,跨平台份额也就没法比。把问题集固化成一张表,采样脚本从表里读,不要手打。
还有一个容易忽略的分层:Google 的 AI Overviews 和 AI Mode 是两个采样对象,不是一个。 同一个查询在两处会命中不同来源集合,AI Mode 与 AI Overviews 的来源差异决定了你不能用一处的份额去代表另一处。想覆盖 Google 侧,两个入口分别采样、分别记份额。
为什么不同工具算出的份额对不上
团队常见的困惑是:三个工具给出三个份额数字,差 10 个百分点以上。原因不是谁算错了,而是四个口径变量各不相同:
| 口径变量 | 常见差异 | 对份额的影响 |
|---|---|---|
| 计数单位 | 每个答案里同一品牌算 1 次,还是出现几次算几次 | 差异可达 5–8 pp,反复点名的品牌被放大 |
| 竞品集合 | 工具自动识别 vs 你手工指定 | 集合每加一家,所有人份额都被稀释 |
| 平台聚合 | 各平台份额取平均 vs 全部事件汇总后算比例 | 小样本平台被过度加权,辛普森陷阱 |
| 提及 vs 引用 | 品牌名出现 算,还是必须带链接才算 | 两个口径可能给出完全相反的排名 |
结论:跨工具比数字没有意义,跨周期比同一工具的数字才有意义。 换工具等于换口径,必须回算历史或直接重开基线。
其中"提及 vs 引用"这一条尤其容易混。品牌名被写进答案正文,和你的页面被列进来源链接,是两条不同的链路:前者靠模型参数里的品牌认知,后者靠可被检索、可被引用的页面。第三方来源建设的优先顺序处理的就是后者。
样本量要多大才算数:重复采样与问题数量的实测门槛
AI 答案存在随机性,样本不够时算出来的份额基本是噪声。我们用同一批数据做了收敛测试,把不同重复次数的结果和 5 次重复的均值对比:
| 每题每平台重复次数 | 与 5 次均值的平均绝对偏差 |
|---|---|
| 1 次 | 6.8 个百分点 |
| 3 次 | 3.4 个百分点 |
| 5 次 | 2.1 个百分点 |
单次采样的平均误差是 6.8 个百分点——比大多数品牌一个季度的真实变化还大。 用单次采样做的竞品对比,结论基本随机。
问题数量同样关键。把问题集从 60 题随机抽到 20 题,四周里前三名的排序变了 2 次;用满 60 题时,前三名排序 0 次变动。
可执行门槛:问题数 ≥ 40、每题每平台重复 ≥ 3 次、连续观测 ≥ 4 周。 达不到这个门槛,5 个百分点以内的份额变动不要写进汇报结论。
管理层复盘该用什么口径:一页纸竞品声量报表
给管理层看的报表,只放一张表、三个数字。多了没人看,少了会误判。
| 品牌 | 商业价值加权份额(本月 / 环比) | 提及计数份额 | 推荐位占比 | 负面限定提及数 |
|---|---|---|---|---|
| 我方 | 24.8% / +2.1pp | 23.7% | 41% | 12 |
| 竞品 D | 21.6% / +4.3pp | 14.2% | 48% | 5 |
| 竞品 B | 18.9% / −3.7pp | 27.4% | 19% | 31 |
三个数字必须同时出现,因为它们回答三个不同的问题:
- 加权份额回答"我们在值钱的问题上占多少位置"。
- 提及计数份额回答"我们的整体曝光盘子有多大"。两个数字差距越大,说明声量结构越畸形。
- 推荐位占比回答"我们是被推荐,还是只被列举"。这个数低于 30% 时,涨份额的性价比远不如改内容形态。
还有一条纪律比公式更重要:权重表一个季度内冻结不改;确实要改,必须回算至少两个历史周期,否则前后数字不可比。 我们见过太多团队在季度末悄悄调高了自己强项问题的意图分,报表瞬间好看——这不是优化,这是自欺。
份额掉了怎么修:从数字回到动作
份额是结果指标,改不动。能改的是它下面的三层:
第一层:形态降级(推荐位 → 候选位)。 说明模型还认得你,但不再把你排在首选。优先补的是"可被直接引用的结论性内容"——明确的适用场景、明确的不适用场景、可对比的参数。含糊的营销语言在决策类问句里会被降格成背景提及。
第二层:决策类问句缺席。 认知类有你、决策类没你,说明缺的是选型证据。可复用的客户结果、带具体数字的案例是最容易被 AI 摘出来的一类内容,把客户案例结构化成可被引用的证据给了具体的组织方式。
第三层:整体消失。 先排除口径问题(竞品集合变没变、问题集改没改),再看是不是内容深度不够。同一话题下深度页和广度页在 AI Mode 里的存活率并不一样,深度与广度的实测对比里有分类数据。
顺序不能反。形态问题当成内容缺失来修,会白写一堆页面。
计算 AI 搜索声量份额时最常见的 6 个错误
- 对百分比求平均,而不是对事件求和后再算比例。 四个平台的份额直接取平均,会让小样本平台获得和大样本平台一样的话语权,典型的辛普森陷阱。正确做法是先汇总所有提及事件,再一次性算份额。
- 竞品集合中途增删却不回算历史。 加一个新竞品,所有人的份额都会掉,这个掉幅和真实表现无关。改集合必须回算。
- 把引用来源份额和提及份额混成一个数。 被答案点名和被答案链接是两件事,分开统计才有诊断价值。
- 只用带品牌词的问句采样。 问"MaxAEO 怎么样"当然会提到你,份额虚高且没有竞争意义。非品牌词发现类问句应占问题集 80% 以上。
- 单次采样就下结论。 见上文,单次采样平均误差 6.8 个百分点。
- 把带否定限定的提及算成正向份额。 实测样本中 4.2% 的提及自带劝退语,这部分应该单列成负面提及指标,甚至作为优先修复清单。
常见问题
AI 搜索声量份额和 AI 提及率有什么区别?
提及率是绝对值——提到你的答案数 ÷ 总采样答案数,反映你在这个品类里的整体存在感。声量份额是相对值——你的提及数 ÷ 所有对标品牌提及总数,反映你和竞品的相对位置。品类整体升温时,提及率涨而份额可能不变;只有份额涨,才说明你确实抢到了竞品的位置。两个指标要一起看。
加权用的意图分 5/3/1 是怎么定的,可以改吗?
这是我们在多个品类实测后的经验档位,作用是把决策类问题的权重拉开到认知类的 5 倍。你完全可以按自己品类的成交路径调整,比如客单价高、决策链长的 B2B 可以把决策类拉到 8。唯一的硬约束是:定下来之后一个季度内不改,改了要回算历史数据。
只监测 DeepSeek 和豆包够不够?
取决于你的买家在哪。消费品牌通常豆包权重最高,B2B 和技术类采购在 DeepSeek、Kimi 上的比重更大。判断依据不该是平台的公开用户量,而是你自己的客户访谈和渠道数据。至少覆盖三个平台,否则单平台的算法波动会被误读成品牌表现变化。
份额掉了,第一步该查什么?
按顺序查三件事:一是竞品集合和问题集有没有变(口径问题最常见);二是掉的是哪一类问题——认知类掉了影响有限,决策类掉了要立刻响应;三是掉的是提及本身还是形态降级,从推荐位掉到候选位和彻底消失,对应完全不同的修复动作。
所有平台突然都开始提我,是好事吗?
不一定,要先排除采样污染。跨平台份额同时跳涨的常见原因有三种:某个高权重来源页(榜单、评测、维基类页面)被多个模型同时抓到、模型版本更新、或者你的采样会话没关记忆。真实的品牌认知变化通常是逐平台错峰发生的。
多久算一次比较合理?
监控层面建议周度跑提及计数份额做异常告警,管理层复盘层面按月或按季跑加权份额。加权份额跑得太频繁没有意义——权重表的主观性会让短周期波动失去解释力。
份额多少算及格?
没有绝对及格线,用两条相对基准:一是"均分线",5 个对标品牌的均分是 20%,低于均分说明你在这个品类里处于劣势位;二是"结构线",推荐位占比 ≥ 30%。份额 25% 但推荐位只有 15%,比份额 18% 而推荐位 45% 的处境更危险——前者的量是虚的。
