AI品牌推荐排名怎么判定:推荐位、候选位与普通提及的四级标准

AI品牌推荐排名四级判定示意:推荐位、候选位、普通提及、仅引用在同一条答案中的分布

统计 AI品牌推荐排名时,最容易出错的一步不是抓数据,而是判定:"被提到"和"被推荐"不是一回事。同一条 DeepSeek 答案,A 同事记成"排第 2",B 同事记成"顺带提了一句",两份周报打架,管理层就不再信这套数字。

问题出在判定规则缺位。品牌名出现在有序列表第二项、出现在"其他还有……"的补充句里、出现在文末参考链接里——这三种情况在多数团队的表格里被记成同一个"提及",甚至被换算成同一个排名。

下面这套四级判定标准(推荐位 / 候选位 / 普通提及 / 仅引用)来自 MaxAEO 标注团队处理中文 AI 答案时沉淀的规则集,重点解决列表顺序、并列推荐、补充提及、引用来源被混算这四类歧义。规则可以直接抄进标注手册。

AI品牌推荐排名四级判定示意:推荐位、候选位、普通提及、仅引用在同一条答案中的分布

什么是 AI 品牌推荐排名:一条答案里有四种"被提到"

AI品牌推荐排名,指品牌在 AI 答案中被明确推荐时所处的位次,只统计构成推荐的提及,不包含背景举例和来源引用。 换句话说,排名的分母不是"出现次数",而是"够得上推荐的出现次数"。

四级标准如下:

级别 代号 判定含义 是否进排名
推荐位 R AI 明确建议选它,并给出理由 是,计位次
候选位 C 进入推荐名单,但无独立展开 是,计位次
普通提及 M 作为背景、举例、对比参照出现 否,只计提及
仅引用 S 仅出现在来源链接或脚注 否,单独计引用

分层的意义在于:提及率高不等于推荐强。一个品牌被 AI 当成"这个品类里还有个做低价的"反复提到,提及率很好看,但一次推荐位都没拿到。这套分层怎么接进完整指标体系,可参考AI品牌可见性怎么衡量:从提及率到推荐位的指标体系

AI品牌推荐排名和传统搜索排名有什么不同

直接把 Google 排名的思路搬过来,是第二个高频错误。两者的排名对象、稳定性和观测方式都不一样:

维度 传统搜索排名 AI品牌推荐排名
排名对象 URL / 页面 品牌名(可能没有链接)
位置数量 首屏约 10 条蓝链 一条答案通常只点名 3–6 个品牌
结果稳定性 同一关键词结果基本一致 同一 Prompt 多次生成结果不同,必须多次采样看分布
观测方式 排名工具直接查 自建 Prompt 集采集 + 人工/规则标注
失败形态 排在第 20 名 根本没被提到,或只进了"其他还有"

关键差异是随机性:传统排名是一个确定值,AI 推荐排名是一个概率分布。所以后面所有讨论都绕不开采样次数和置信区间——单次答案里排第 1,不构成任何结论。

为什么列表位序不等于推荐强度

答案先行:只有"偏好排序"的序号能当推荐强度用,另外两种排序的序号不能。

三种排序逻辑要分开辨别:

  • 偏好排序:AI 先给结论再列名单,"最推荐的是 X,其次是 Y"。序号 = 推荐强度,可直接采信。
  • 枚举排序:AI 在罗列品类玩家,常按知名度、成立时间、价格从低到高排列。序号 ≈ 属性顺序,不是偏好。
  • 场景排序:AI 按使用场景分组,"预算有限选 X,追求性能选 Y"。组内序号无可比性,跨组序号更无意义。

辨别方法很简单:看列表前后有没有偏好动词。出现"推荐""建议优先""首选""综合来看最合适"才判偏好排序;只有"包括""主要有""市面上常见的"则判枚举。判错这一步,后面所有 AI搜索排名数据都是错的。

我们的实测样本里,含列表的中文答案中枚举排序占 61%,偏好排序仅 27%,场景排序 12%。也就是说,把列表序号直接当排名用,超过七成的数据会被算错方向。

推荐位(R)怎么判:五条硬标准

推荐位是最高一级判定,标准要严。品牌满足以下五条中的任意两条,且不触发排除项,才记为推荐位——只满足一条一律降级为候选位。

  1. 有明确推荐动词指向该品牌:"推荐""建议选""首选""值得考虑"。
  2. 有独立成段的展开:不少于两句话说明它适合谁、强在哪。
  3. 给出了区分性理由:说明它相对其他选项的差异点,而不是复述通用卖点。
  4. 出现在结论句里:答案末尾的"综合建议""如果只选一个"段落中被点名。
  5. 被赋予场景归属:"如果你是中小团队,选 X"这类明确的场景绑定。

排除项一条否决:若同句出现负面限定("但价格偏高""不适合……")且无补偿性正面表述,降级为候选位并另记情感为负向。否则舆情监控里的负面推荐会被当成正向战绩上报。

候选位(C)与普通提及(M)的分界线

分界只有一条:品牌是否被放进了"可选清单"。进了清单、哪怕只有名字没有描述,也算候选位;没进清单、只是被顺带说起,就是普通提及。

具体三条判据:

  • 进清单:出现在有序/无序列表项、表格行、"可以考虑 A、B、C"的并列结构中 → C。
  • 未进清单:出现在定义句、行业背景句、"以 X 为例"的举例句、竞品对比的参照方 → M。
  • 补充句处理:"此外还有 X、Y"这类补充句,判 C 但位次记为清单末位,不与主清单同权重。

实操中争议最大的是最后一条。补充句里的品牌确实进了名单,但 AI 明显把它当次要选项。硬记成"第 4 名"会虚高,直接踢出排名又丢信息——记为 C 且位次归入末档,是折中后最稳定的做法。位次口径的细节可对照AI推荐位置怎么统计:第一个提到、进入名单和被重点解释分别怎么算

只在引用来源里出现算不算被推荐

不算。 品牌域名出现在参考链接、角标脚注或"来源"区块,正文却没提品牌名,判为仅引用(S),单独计入引用指标,不并入提及率或推荐排名。

理由是两者的用户价值不同:正文提及影响用户决策,来源链接影响的是 AI 对你的信任度。混算会造成一种典型误判——内容型品牌的引用被大量计入提及,看上去可见度很高,实际用户在答案正文里根本看不到品牌名。提及率本身怎么定义和计算,见AI提及率是什么?计算方法、指标体系与提升指南

但 S 级不是坏事,它是推荐位的前置信号。品牌网站被反复当作证据源引用,通常先于正文推荐出现。把 S 单独建列、观察它向 R/C 的转化,是判断 AEO 优化是否起效的早期指标。

答案正文提及与来源链接引用的区别标注示例

疑难答案形态裁决表

遇到拿不准的直接查表,不要临场自由心证。

答案形态 典型表述 判定 位次记法
并列推荐 "推荐 X 和 Y,两者各有优势" 双方均记 R 并列第 1,不拆先后
分场景推荐 "预算型选 X,专业型选 Y" 各自记 R 组内第 1,另记场景标签
表格答案 品牌表格,无排序说明 全部记 C 按行序记位次,标注"枚举"
括号补充 "主流工具(如 X、Y)" 记 M 不计位次
竞品对比参照 "相比 X,Y 更适合……" X 记 M,Y 记 R X 无位次
否定式提及 "不建议选 X,除非……" 记 M,情感负向 不计位次

三条通用裁决原则兜底:并列不拆序(AI 没排先后,标注人也不许排);跨场景不比较(不同场景的第 1 名不能合并成"平均排第 1");枚举结构降权不降级(记 C 保留信息,靠权重体现它不如偏好排序值钱)。

实测分布:1842 条中文答案里,四级各占多少

判定规则的档位设计不是拍脑袋定的,而是跟着真实分布走。以下是 MaxAEO 标注团队 2026 年 4–6 月的内部标注复盘。

样本口径:DeepSeek、豆包、Kimi、通义千问四个平台,覆盖 SaaS 工具、家电、母婴、跨境物流等 12 个中文品类,386 个 Prompt,每个 Prompt 采集 3–5 次,共 1842 条答案,全部双人独立标注。仅代表该样本,不构成行业普查。

主要结果:

  • 平均每条答案点名品牌 4.7 个;四级占全部品牌出现次数的比例为 R 18%、C 41%、M 33%、S 8%
  • 也就是说,把所有"出现"都当成推荐,会把真实推荐量放大约 4 倍
  • 首轮双人标注的分歧率 12.4%。分歧构成:C 与 M 的边界占 57%,位次记法占 24%,情感方向占 11%,其他 8%。
  • 六种疑难形态贡献了 34% 的分歧——这正是上面那张裁决表存在的理由。

平台间差异同样明显,这也是不能跨平台取平均的直接证据:

平台 平均点名品牌数 含明确推荐动词的答案占比 附来源链接的答案占比
DeepSeek 5.8 31% 高(联网模式下)
豆包 3.9 44%
Kimi 4.5 36%
通义千问 4.2 33%

豆包给的名单最短、推荐语气最明确,DeepSeek 名单最长但更偏枚举。 同一个品牌在豆包拿一次推荐位,含金量高于在 DeepSeek 挤进第 5 位。平台间的结构性差异怎么系统拆解,可参考AI搜索竞争格局怎么分析:品类、场景、价格带和证据来源四张图

从判定到打分:位序权重不要线性递减

判定完要换算成分数,最常见的错误是用 1/位次 做权重。线性衰减会高估第 4 名以后的价值,也抹平第 1 名和第 2 名的真实差距。

改用三档阶梯权重

位次档 权重 依据
首位(R 且第 1) 1.0 用户决策收敛点,直接影响选型
前三(R 或 C,2–3 位) 0.7 进入主对比集,仍有转化机会
四位及以后 0.4 多数用户不会展开阅读
补充句 / 枚举末档 0.2 有名无实的清单席位

阶梯的理由是注意力分布本就不连续:生成式答案里列表前三项通常在首屏内,第四项起需要滚动,衰减是断崖式而非匀速的。分档还有个工程好处——位次抖动 1 位不会引起分数剧烈变化,周报曲线更稳,不用天天解释噪声。

采样:采哪些问题,采多少条

Prompt 集怎么搭

样本量之前先解决"采什么"。只采"XX 品牌推荐"这类问题,会系统性低估你在决策链其他环节的表现。建议按四类配比:

  • 品类型(约 40%):"做 XX 用什么工具比较好"——决定基础推荐位。
  • 场景型(约 30%):"预算 5 万的中小团队选哪家"——决定你能不能拿到场景绑定。
  • 对比型(约 20%):"A 和 B 哪个更适合 XX"——决定你是主角还是参照方。
  • 品牌型(约 10%):"XX 这家怎么样"——用于监控情感和事实错误。

Prompt 集一旦定下就要冻结,中途加减题目会让环比数据失去可比性;确需调整时,新老两套并行采一个周期再切换。

样本量与置信区间对照

按比例的正态近似区间(半宽 = 1.96 × √(p(1−p)/n)),在最保守的 p=50% 下:

样本量 n 单期 95% 置信区间半宽 两期差值可判定的最小变化
30 ±17.9pp ±25.3pp(基本不可用)
50 ±13.9pp ±19.6pp(只能看方向)
100 ±9.8pp ±13.9pp
200 ±6.9pp ±9.8pp
400 ±4.9pp ±6.9pp

注意第三列——这是最多人算错的一步:比较两个周期时,差值的不确定性约为单期的 √2 倍。100 条样本能稳住的单期区间是 ±9.8pp,但要判定"这周比上周涨了",变化幅度得超过 13.9pp。

结论很直接:样本量低于 100 条时,不要在周报里写"提及率提升了 5 个百分点",这个数字在统计上和没变化区分不开。在 p=50% 的最保守假设下要稳定判定 5pp 变化,每期需要约 770 条;但真实项目里品牌提及率多在 10–20% 区间,此时 n≈400 就足够判定 5pp

常见配置:每平台每个核心 Prompt 采 3–5 次、覆盖 30–50 个 Prompt,单平台单周期落在 100–250 条。跨平台时各自分开算区间,不能合并后再比。波动到多大才该报警,可对照AI推荐异常预警阈值怎么设:提及率、排名和情感波动分别看多大

两个人标同一批答案,结果能不能对上

能不能对上要用数据验证,不能靠感觉。标准做法是双人独立标注同一批 50–100 条答案,用 Cohen’s Kappa 衡量一致性:κ = (Po − Pe) / (1 − Pe),Po 是实际一致率,Pe 是随机一致率。

Landis 与 Koch 1977 年发表于《Biometrics》的经典分级,κ 在 0.61–0.80 为 substantial,0.81 以上为 almost perfect。标注规范上线前,两名标注员的 κ 要达到 0.61 以上;低于 0.4 说明规则本身有歧义,该改的是规范不是人。

我们自己第一版规范的首轮 κ 只有 0.52,分歧几乎全部集中在 C/M 边界。做法不是加定义,而是把 20 条真实分歧样本的原文连同裁决理由抄进规范,第二轮 κ 升到 0.74,两周后复测 0.71。

一致性不达标时的排查顺序:

  1. 先看分歧集中在哪一级——多数争议出在 C 与 M 的边界。
  2. 把分歧样本原文抄进规范当范例,比加一行抽象定义有用得多。
  3. 引入第三人仲裁,仲裁结果回写规范,形成闭环。
  4. 每季度复测一次 κ,AI 答案的行文风格会变,规则会漂移。

这一步大多数团队会跳过,也正是竞品分析结论互相矛盾的根源:不是数据错了,是两边的口径从一开始就不一样。

判定跑通之后:三种典型分布对应三种动作

判定本身不产生排名提升,但它能定位问题出在哪一环。按四级分布的形态对症下药:

  • M 多、R 少(被当背景板):缺的是结论型内容和场景绑定。补"什么情况下该选我们"的明确表述,让 AI 有可摘录的推荐句。
  • S 多、R 少(被当证据源):内容够权威但品牌没进名单。在被引用的页面里补品牌名与产品名的共现、补可直接抄进答案的对比表。
  • R/C/M/S 全部为零(完全不出现):先解决内容覆盖,再谈排名——这是选题问题,不是优化问题。

同时记住一件事:四级分布本身不是业务指标。它解释的是"AI 为什么这样说你",最终仍要接到线索和成交上去复盘,判定口径怎么写进定期报告、管理层看哪几行,可参考AI可见性报告怎么写:指标口径、周报模板与管理层解读

一页纸标注规范与上线自检清单

标注单条答案的顺序固定为:先判排序类型 → 再判级别 → 最后记位次和情感,顺序不能颠倒。

上线前逐条自检:

  • 四级定义(R/C/M/S)写进规范,各配至少两个真实答案范例
  • 偏好排序 / 枚举排序 / 场景排序的辨别句式已列出
  • 六种疑难形态的裁决结果已固化,标注员不得自由裁量
  • 位序权重采用分档而非线性,档位阈值写死
  • 单平台单周期样本量 ≥ 100,报告中标注置信区间,环比用差值区间
  • Prompt 集配比与冻结规则明确,改题时新老并行一期
  • 双人标注 Cohen’s Kappa ≥ 0.61,附仲裁流程与季度复测
  • 引用来源(S)单独建列,不并入提及率
  • 负面语境下的推荐单独标记,不计入正向战绩
  • 跨平台数据分开呈现,不做简单平均

清单跑通后,AI品牌推荐排名才具备横向比较和纵向追踪的资格。否则每个人的尺子都不一样,你永远说不清排名变化是优化带来的,还是标注口径变了。

常见问题

AI 说"推荐 A 和 B",到底谁排第一?
并列第一,不拆先后。AI 未给出偏好排序时,按出现顺序排会引入系统性偏差——并列表述中的前后顺序很大程度由词频和音节长度决定,不代表推荐强度。两者都记 R,位次同为 1。

品牌只出现在答案的参考链接里,要不要算进提及率?
不算。这属于仅引用(S),单独统计。它反映的是 AI 对品牌内容的信任度,不是用户在答案正文里的可见度。混算会让内容型品牌的数据严重虚高。

一周只采了 30 条答案,能不能出排名报告?
可以出趋势观察,不能出结论。30 条样本的单期 95% 区间半宽接近 ±18pp,环比差值要超过 25pp 才有统计意义。要出可汇报的结论,单平台单周期至少 100 条。

AI 说"不建议选 X",这条要计入提及率吗?
计入提及,但记为普通提及(M)、情感负向,且不计位次。负面提及必须单独可筛,否则提及率上涨可能是负面舆情扩散,而不是优化起效。

不同 AI 平台的推荐排名能不能取平均?
不建议。各平台的答案长度、列表结构和推荐语气差异很大(实测平均点名品牌数从 3.9 到 5.8 不等),平均后的数字既不反映任何单一平台,也掩盖了平台间差距。正确做法是分平台呈现,再按各平台在目标人群中的使用份额加权汇总。

判定能不能交给大模型自动标,不用人工?
可以做预标注,但 R/C 边界和情感方向必须人工复核。自动标注在"进没进清单"这类结构判断上表现稳定,在"推荐理由够不够构成推荐位"这类语义判断上误判集中,且误判方向偏乐观——会系统性抬高 R 的占比。

多久统计一次比较合适?
内容改动频繁期按周,稳定期按月。低于周频会漏掉平台更新造成的突变;高于周频则样本量摊不开,看到的多半是采样噪声。