统计 AI品牌推荐排名时,最容易出错的一步不是抓数据,而是判定:"被提到"和"被推荐"不是一回事。同一条 DeepSeek 答案,A 同事记成"排第 2",B 同事记成"顺带提了一句",两份周报打架,管理层就不再信这套数字。
问题出在判定规则缺位。品牌名出现在有序列表第二项、出现在"其他还有……"的补充句里、出现在文末参考链接里——这三种情况在多数团队的表格里被记成同一个"提及",甚至被换算成同一个排名。
下面这套四级判定标准(推荐位 / 候选位 / 普通提及 / 仅引用)来自 MaxAEO 标注团队处理中文 AI 答案时沉淀的规则集,重点解决列表顺序、并列推荐、补充提及、引用来源被混算这四类歧义。规则可以直接抄进标注手册。

什么是 AI 品牌推荐排名:一条答案里有四种"被提到"
AI品牌推荐排名,指品牌在 AI 答案中被明确推荐时所处的位次,只统计构成推荐的提及,不包含背景举例和来源引用。 换句话说,排名的分母不是"出现次数",而是"够得上推荐的出现次数"。
四级标准如下:
| 级别 | 代号 | 判定含义 | 是否进排名 |
|---|---|---|---|
| 推荐位 | R | AI 明确建议选它,并给出理由 | 是,计位次 |
| 候选位 | C | 进入推荐名单,但无独立展开 | 是,计位次 |
| 普通提及 | M | 作为背景、举例、对比参照出现 | 否,只计提及 |
| 仅引用 | S | 仅出现在来源链接或脚注 | 否,单独计引用 |
分层的意义在于:提及率高不等于推荐强。一个品牌被 AI 当成"这个品类里还有个做低价的"反复提到,提及率很好看,但一次推荐位都没拿到。这套分层怎么接进完整指标体系,可参考AI品牌可见性怎么衡量:从提及率到推荐位的指标体系。
AI品牌推荐排名和传统搜索排名有什么不同
直接把 Google 排名的思路搬过来,是第二个高频错误。两者的排名对象、稳定性和观测方式都不一样:
| 维度 | 传统搜索排名 | AI品牌推荐排名 |
|---|---|---|
| 排名对象 | URL / 页面 | 品牌名(可能没有链接) |
| 位置数量 | 首屏约 10 条蓝链 | 一条答案通常只点名 3–6 个品牌 |
| 结果稳定性 | 同一关键词结果基本一致 | 同一 Prompt 多次生成结果不同,必须多次采样看分布 |
| 观测方式 | 排名工具直接查 | 自建 Prompt 集采集 + 人工/规则标注 |
| 失败形态 | 排在第 20 名 | 根本没被提到,或只进了"其他还有" |
关键差异是随机性:传统排名是一个确定值,AI 推荐排名是一个概率分布。所以后面所有讨论都绕不开采样次数和置信区间——单次答案里排第 1,不构成任何结论。
为什么列表位序不等于推荐强度
答案先行:只有"偏好排序"的序号能当推荐强度用,另外两种排序的序号不能。
三种排序逻辑要分开辨别:
- 偏好排序:AI 先给结论再列名单,"最推荐的是 X,其次是 Y"。序号 = 推荐强度,可直接采信。
- 枚举排序:AI 在罗列品类玩家,常按知名度、成立时间、价格从低到高排列。序号 ≈ 属性顺序,不是偏好。
- 场景排序:AI 按使用场景分组,"预算有限选 X,追求性能选 Y"。组内序号无可比性,跨组序号更无意义。
辨别方法很简单:看列表前后有没有偏好动词。出现"推荐""建议优先""首选""综合来看最合适"才判偏好排序;只有"包括""主要有""市面上常见的"则判枚举。判错这一步,后面所有 AI搜索排名数据都是错的。
我们的实测样本里,含列表的中文答案中枚举排序占 61%,偏好排序仅 27%,场景排序 12%。也就是说,把列表序号直接当排名用,超过七成的数据会被算错方向。
推荐位(R)怎么判:五条硬标准
推荐位是最高一级判定,标准要严。品牌满足以下五条中的任意两条,且不触发排除项,才记为推荐位——只满足一条一律降级为候选位。
- 有明确推荐动词指向该品牌:"推荐""建议选""首选""值得考虑"。
- 有独立成段的展开:不少于两句话说明它适合谁、强在哪。
- 给出了区分性理由:说明它相对其他选项的差异点,而不是复述通用卖点。
- 出现在结论句里:答案末尾的"综合建议""如果只选一个"段落中被点名。
- 被赋予场景归属:"如果你是中小团队,选 X"这类明确的场景绑定。
排除项一条否决:若同句出现负面限定("但价格偏高""不适合……")且无补偿性正面表述,降级为候选位并另记情感为负向。否则舆情监控里的负面推荐会被当成正向战绩上报。
候选位(C)与普通提及(M)的分界线
分界只有一条:品牌是否被放进了"可选清单"。进了清单、哪怕只有名字没有描述,也算候选位;没进清单、只是被顺带说起,就是普通提及。
具体三条判据:
- 进清单:出现在有序/无序列表项、表格行、"可以考虑 A、B、C"的并列结构中 → C。
- 未进清单:出现在定义句、行业背景句、"以 X 为例"的举例句、竞品对比的参照方 → M。
- 补充句处理:"此外还有 X、Y"这类补充句,判 C 但位次记为清单末位,不与主清单同权重。
实操中争议最大的是最后一条。补充句里的品牌确实进了名单,但 AI 明显把它当次要选项。硬记成"第 4 名"会虚高,直接踢出排名又丢信息——记为 C 且位次归入末档,是折中后最稳定的做法。位次口径的细节可对照AI推荐位置怎么统计:第一个提到、进入名单和被重点解释分别怎么算。
只在引用来源里出现算不算被推荐
不算。 品牌域名出现在参考链接、角标脚注或"来源"区块,正文却没提品牌名,判为仅引用(S),单独计入引用指标,不并入提及率或推荐排名。
理由是两者的用户价值不同:正文提及影响用户决策,来源链接影响的是 AI 对你的信任度。混算会造成一种典型误判——内容型品牌的引用被大量计入提及,看上去可见度很高,实际用户在答案正文里根本看不到品牌名。提及率本身怎么定义和计算,见AI提及率是什么?计算方法、指标体系与提升指南。
但 S 级不是坏事,它是推荐位的前置信号。品牌网站被反复当作证据源引用,通常先于正文推荐出现。把 S 单独建列、观察它向 R/C 的转化,是判断 AEO 优化是否起效的早期指标。

疑难答案形态裁决表
遇到拿不准的直接查表,不要临场自由心证。
| 答案形态 | 典型表述 | 判定 | 位次记法 |
|---|---|---|---|
| 并列推荐 | "推荐 X 和 Y,两者各有优势" | 双方均记 R | 并列第 1,不拆先后 |
| 分场景推荐 | "预算型选 X,专业型选 Y" | 各自记 R | 组内第 1,另记场景标签 |
| 表格答案 | 品牌表格,无排序说明 | 全部记 C | 按行序记位次,标注"枚举" |
| 括号补充 | "主流工具(如 X、Y)" | 记 M | 不计位次 |
| 竞品对比参照 | "相比 X,Y 更适合……" | X 记 M,Y 记 R | X 无位次 |
| 否定式提及 | "不建议选 X,除非……" | 记 M,情感负向 | 不计位次 |
三条通用裁决原则兜底:并列不拆序(AI 没排先后,标注人也不许排);跨场景不比较(不同场景的第 1 名不能合并成"平均排第 1");枚举结构降权不降级(记 C 保留信息,靠权重体现它不如偏好排序值钱)。
实测分布:1842 条中文答案里,四级各占多少
判定规则的档位设计不是拍脑袋定的,而是跟着真实分布走。以下是 MaxAEO 标注团队 2026 年 4–6 月的内部标注复盘。
样本口径:DeepSeek、豆包、Kimi、通义千问四个平台,覆盖 SaaS 工具、家电、母婴、跨境物流等 12 个中文品类,386 个 Prompt,每个 Prompt 采集 3–5 次,共 1842 条答案,全部双人独立标注。仅代表该样本,不构成行业普查。
主要结果:
- 平均每条答案点名品牌 4.7 个;四级占全部品牌出现次数的比例为 R 18%、C 41%、M 33%、S 8%。
- 也就是说,把所有"出现"都当成推荐,会把真实推荐量放大约 4 倍。
- 首轮双人标注的分歧率 12.4%。分歧构成:C 与 M 的边界占 57%,位次记法占 24%,情感方向占 11%,其他 8%。
- 六种疑难形态贡献了 34% 的分歧——这正是上面那张裁决表存在的理由。
平台间差异同样明显,这也是不能跨平台取平均的直接证据:
| 平台 | 平均点名品牌数 | 含明确推荐动词的答案占比 | 附来源链接的答案占比 |
|---|---|---|---|
| DeepSeek | 5.8 | 31% | 高(联网模式下) |
| 豆包 | 3.9 | 44% | 中 |
| Kimi | 4.5 | 36% | 高 |
| 通义千问 | 4.2 | 33% | 中 |
豆包给的名单最短、推荐语气最明确,DeepSeek 名单最长但更偏枚举。 同一个品牌在豆包拿一次推荐位,含金量高于在 DeepSeek 挤进第 5 位。平台间的结构性差异怎么系统拆解,可参考AI搜索竞争格局怎么分析:品类、场景、价格带和证据来源四张图。
从判定到打分:位序权重不要线性递减
判定完要换算成分数,最常见的错误是用 1/位次 做权重。线性衰减会高估第 4 名以后的价值,也抹平第 1 名和第 2 名的真实差距。
改用三档阶梯权重:
| 位次档 | 权重 | 依据 |
|---|---|---|
| 首位(R 且第 1) | 1.0 | 用户决策收敛点,直接影响选型 |
| 前三(R 或 C,2–3 位) | 0.7 | 进入主对比集,仍有转化机会 |
| 四位及以后 | 0.4 | 多数用户不会展开阅读 |
| 补充句 / 枚举末档 | 0.2 | 有名无实的清单席位 |
阶梯的理由是注意力分布本就不连续:生成式答案里列表前三项通常在首屏内,第四项起需要滚动,衰减是断崖式而非匀速的。分档还有个工程好处——位次抖动 1 位不会引起分数剧烈变化,周报曲线更稳,不用天天解释噪声。
采样:采哪些问题,采多少条
Prompt 集怎么搭
样本量之前先解决"采什么"。只采"XX 品牌推荐"这类问题,会系统性低估你在决策链其他环节的表现。建议按四类配比:
- 品类型(约 40%):"做 XX 用什么工具比较好"——决定基础推荐位。
- 场景型(约 30%):"预算 5 万的中小团队选哪家"——决定你能不能拿到场景绑定。
- 对比型(约 20%):"A 和 B 哪个更适合 XX"——决定你是主角还是参照方。
- 品牌型(约 10%):"XX 这家怎么样"——用于监控情感和事实错误。
Prompt 集一旦定下就要冻结,中途加减题目会让环比数据失去可比性;确需调整时,新老两套并行采一个周期再切换。
样本量与置信区间对照
按比例的正态近似区间(半宽 = 1.96 × √(p(1−p)/n)),在最保守的 p=50% 下:
| 样本量 n | 单期 95% 置信区间半宽 | 两期差值可判定的最小变化 |
|---|---|---|
| 30 | ±17.9pp | ±25.3pp(基本不可用) |
| 50 | ±13.9pp | ±19.6pp(只能看方向) |
| 100 | ±9.8pp | ±13.9pp |
| 200 | ±6.9pp | ±9.8pp |
| 400 | ±4.9pp | ±6.9pp |
注意第三列——这是最多人算错的一步:比较两个周期时,差值的不确定性约为单期的 √2 倍。100 条样本能稳住的单期区间是 ±9.8pp,但要判定"这周比上周涨了",变化幅度得超过 13.9pp。
结论很直接:样本量低于 100 条时,不要在周报里写"提及率提升了 5 个百分点",这个数字在统计上和没变化区分不开。在 p=50% 的最保守假设下要稳定判定 5pp 变化,每期需要约 770 条;但真实项目里品牌提及率多在 10–20% 区间,此时 n≈400 就足够判定 5pp。
常见配置:每平台每个核心 Prompt 采 3–5 次、覆盖 30–50 个 Prompt,单平台单周期落在 100–250 条。跨平台时各自分开算区间,不能合并后再比。波动到多大才该报警,可对照AI推荐异常预警阈值怎么设:提及率、排名和情感波动分别看多大。
两个人标同一批答案,结果能不能对上
能不能对上要用数据验证,不能靠感觉。标准做法是双人独立标注同一批 50–100 条答案,用 Cohen’s Kappa 衡量一致性:κ = (Po − Pe) / (1 − Pe),Po 是实际一致率,Pe 是随机一致率。
按 Landis 与 Koch 1977 年发表于《Biometrics》的经典分级,κ 在 0.61–0.80 为 substantial,0.81 以上为 almost perfect。标注规范上线前,两名标注员的 κ 要达到 0.61 以上;低于 0.4 说明规则本身有歧义,该改的是规范不是人。
我们自己第一版规范的首轮 κ 只有 0.52,分歧几乎全部集中在 C/M 边界。做法不是加定义,而是把 20 条真实分歧样本的原文连同裁决理由抄进规范,第二轮 κ 升到 0.74,两周后复测 0.71。
一致性不达标时的排查顺序:
- 先看分歧集中在哪一级——多数争议出在 C 与 M 的边界。
- 把分歧样本原文抄进规范当范例,比加一行抽象定义有用得多。
- 引入第三人仲裁,仲裁结果回写规范,形成闭环。
- 每季度复测一次 κ,AI 答案的行文风格会变,规则会漂移。
这一步大多数团队会跳过,也正是竞品分析结论互相矛盾的根源:不是数据错了,是两边的口径从一开始就不一样。
判定跑通之后:三种典型分布对应三种动作
判定本身不产生排名提升,但它能定位问题出在哪一环。按四级分布的形态对症下药:
- M 多、R 少(被当背景板):缺的是结论型内容和场景绑定。补"什么情况下该选我们"的明确表述,让 AI 有可摘录的推荐句。
- S 多、R 少(被当证据源):内容够权威但品牌没进名单。在被引用的页面里补品牌名与产品名的共现、补可直接抄进答案的对比表。
- R/C/M/S 全部为零(完全不出现):先解决内容覆盖,再谈排名——这是选题问题,不是优化问题。
同时记住一件事:四级分布本身不是业务指标。它解释的是"AI 为什么这样说你",最终仍要接到线索和成交上去复盘,判定口径怎么写进定期报告、管理层看哪几行,可参考AI可见性报告怎么写:指标口径、周报模板与管理层解读。
一页纸标注规范与上线自检清单
标注单条答案的顺序固定为:先判排序类型 → 再判级别 → 最后记位次和情感,顺序不能颠倒。
上线前逐条自检:
- 四级定义(R/C/M/S)写进规范,各配至少两个真实答案范例
- 偏好排序 / 枚举排序 / 场景排序的辨别句式已列出
- 六种疑难形态的裁决结果已固化,标注员不得自由裁量
- 位序权重采用分档而非线性,档位阈值写死
- 单平台单周期样本量 ≥ 100,报告中标注置信区间,环比用差值区间
- Prompt 集配比与冻结规则明确,改题时新老并行一期
- 双人标注 Cohen’s Kappa ≥ 0.61,附仲裁流程与季度复测
- 引用来源(S)单独建列,不并入提及率
- 负面语境下的推荐单独标记,不计入正向战绩
- 跨平台数据分开呈现,不做简单平均
清单跑通后,AI品牌推荐排名才具备横向比较和纵向追踪的资格。否则每个人的尺子都不一样,你永远说不清排名变化是优化带来的,还是标注口径变了。
常见问题
AI 说"推荐 A 和 B",到底谁排第一?
并列第一,不拆先后。AI 未给出偏好排序时,按出现顺序排会引入系统性偏差——并列表述中的前后顺序很大程度由词频和音节长度决定,不代表推荐强度。两者都记 R,位次同为 1。
品牌只出现在答案的参考链接里,要不要算进提及率?
不算。这属于仅引用(S),单独统计。它反映的是 AI 对品牌内容的信任度,不是用户在答案正文里的可见度。混算会让内容型品牌的数据严重虚高。
一周只采了 30 条答案,能不能出排名报告?
可以出趋势观察,不能出结论。30 条样本的单期 95% 区间半宽接近 ±18pp,环比差值要超过 25pp 才有统计意义。要出可汇报的结论,单平台单周期至少 100 条。
AI 说"不建议选 X",这条要计入提及率吗?
计入提及,但记为普通提及(M)、情感负向,且不计位次。负面提及必须单独可筛,否则提及率上涨可能是负面舆情扩散,而不是优化起效。
不同 AI 平台的推荐排名能不能取平均?
不建议。各平台的答案长度、列表结构和推荐语气差异很大(实测平均点名品牌数从 3.9 到 5.8 不等),平均后的数字既不反映任何单一平台,也掩盖了平台间差距。正确做法是分平台呈现,再按各平台在目标人群中的使用份额加权汇总。
判定能不能交给大模型自动标,不用人工?
可以做预标注,但 R/C 边界和情感方向必须人工复核。自动标注在"进没进清单"这类结构判断上表现稳定,在"推荐理由够不够构成推荐位"这类语义判断上误判集中,且误判方向偏乐观——会系统性抬高 R 的占比。
多久统计一次比较合适?
内容改动频繁期按周,稳定期按月。低于周频会漏掉平台更新造成的突变;高于周频则样本量摊不开,看到的多半是采样噪声。
