AI 搜索可见性监测,是用固定问题集反复向 AI 助手提问、统计品牌在回答中出现频率与位置的持续测量方法。 它测的不是关键词排名,而是"用户问 AI 时,你出不出现、排第几、AI 读没读你的内容"。
难点从来不是"要不要测",而是测出来的数字能不能信。同一个问题问两次,AI 可能给两份不同的名单;换个说法提问,品牌就消失了。绝大多数团队第一次做监测时,拿到的是一条每天上下跳 20 个百分点的曲线,然后据此做了错误的优化决策。
本文解决的正是这一层:指标怎么定义才不含糊,采样多少次结果才稳定,数字变了怎么判断是真变化还是噪声。

什么是 AI 搜索可见性,它和关键词排名有何区别
第一,位置不再离散。 搜索排名是第 1 位或第 8 位,边界清晰;AI 回答里品牌可能出现在正文推荐名单中,也可能只躺在折叠的"参考来源"里,两者价值差着数量级。
第二,结果不确定。 同一查询在传统搜索引擎里短期内高度稳定,而大模型带温度采样,同一问题连问十次可能得到十份略有差异的答案。
第三,入口是自然语言。 用户输入的不是"CRM 软件",而是"三十人的销售团队用什么 CRM 比较省事"。可见性必须按问题测,不能按关键词测。
第四,没有官方后台。 关键词排名有 Search Console 兜底,AI 回答里的提及没有任何一家平台提供官方数据接口。所有可见性数字都是你自己采样估出来的——这也是为什么口径和采样量必须先说清楚。
这四点决定了监测方法必须重做,而不是把排名工具的输出换个标题。
判断品牌是否被 AI 看见:四层指标口径
把"被看见"拆成四层,每层回答一个不同的问题。混用口径是团队之间扯皮的最大来源——市场部说提及率 40%,代理商说只有 12%,往往只是两边算的不是同一件事。
| 指标 | 口径公式 | 回答什么问题 |
|---|---|---|
| 提及率 Mention Rate | 品牌出现的回答数 ÷ 总回答数 | AI 知不知道有我 |
| 首推率 First-Position Rate | 品牌排在推荐名单第一位的回答数 ÷ 总回答数 | AI 优先推谁 |
| 引用率 Citation Rate | 回答引用了本站域名的次数 ÷ 总回答数 | AI 读的是不是我的内容 |
| 答案份额 Share of Answer | 品牌提及次数 ÷ 该题所有品牌提及总次数 | 我在这个赛道占几成 |
四层之间不是递进关系,而是诊断坐标。四种组合对应四套完全不同的动作:
| 提及率 | 引用率 | 诊断 | 该做什么 |
|---|---|---|---|
| 高 | 低 | AI 靠第三方口碑认识你 | 投第三方信源,改官网收效有限 |
| 低 | 高 | 内容被读了但没被采信 | 补证据、补权威信号 |
| 高 | 高 | 健康 | 守住,盯答案份额 |
| 低 | 低 | 抓取或索引层出了问题 | 先查爬虫和渲染 |
引用率高但首推率低是另一种典型失衡:内容被当作背景资料而非首选答案,被引用不等于被推荐的排查方法拆了这条链路。
再补两个成本低但常被漏掉的维度:情感倾向(提及是正面、中性还是"这家有过负面新闻")和信息准确性(AI 说的产品定位、价格区间、适用规模对不对)。被错误地提及,比不被提及更伤转化。
单次提问的结果为什么不可信:采样量该怎么定
这是全文最该记住的一节。 大模型输出带随机性,单次提问得到的"提及/未提及"是一次伯努利试验,把它当成测量结果,等于抛一次硬币就断言硬币的正面概率。
按二项分布的正态近似,比例估计的 95% 置信区间半宽为 1.96 × √(p(1−p)/n)。取最保守的 p=0.5,不同采样次数下的误差如下:
| 每题采样次数 n | 95% 置信区间半宽(p=0.5) | 实际含义 |
|---|---|---|
| 10 | ±31.0 个百分点 | 基本不可用 |
| 30 | ±17.9 个百分点 | 只能看有无,看不了变化 |
| 50 | ±13.9 个百分点 | 勉强可读趋势 |
| 100 | ±9.8 个百分点 | 可用的最低线 |
| 200 | ±6.9 个百分点 | 可做优化前后对比 |
真实提及率通常低于 50%,误差会小一些:当 p≈0.2、n=100 时,半宽约 ±7.8 个百分点。
关键推论在下一步:要判断优化后"真的涨了",比较的是两个独立估计的差值,其标准误约为单次的 √2 倍。在 p≈0.2、每次各采样 100 条的条件下,两期之间的差异至少要超过约 11 个百分点,才在统计上站得住脚。 涨了 5 个点就开庆功会,多半是在庆祝噪声。
落到执行上有三条硬约束:
- 每题每平台每期至少 30 次采样,预算允许时做到 100 次;采样次数少就只报"是否出现",不报百分比。
- 问题集固定,措辞一字不改。 换了问法就是换了实验,历史数据作废。
- 同一期的采样集中在较短时间窗内完成,避开模型版本更新和大促节点,否则波动来源无法归因。
顺带一句:跨平台的绝对值不可比。 不同模型的回答长度、是否联网检索、推荐名单默认给几个,差异极大,同一品牌在两个平台上的提及率相差一倍是常态。跨平台只比趋势和答案份额,不比绝对数。关于这种平台间的分歧到底有多大,九个国产 AI 的答案分歧度实测提供了更细的对照。
中文平台怎么采:按接口可得性分三档
中文场景的最大变量不是指标设计,而是能不能稳定拿到回答。按采集难度分三档,排期和成本完全不同:
| 档位 | 平台特征 | 采集方式 | 每题 100 次采样的现实成本 |
|---|---|---|---|
| A 档:有开放 API | 通义千问、豆包、Kimi、智谱等提供开发者接口的模型 | 直接调 API,可脚本化、可并发 | 低,按 token 计费,单题几毛到几元 |
| B 档:有 API 但答案不同源 | 同一品牌的 App/网页版接了联网检索,API 版可能不联网 | 调 API 只能测"模型知道什么",测不了"联网后推荐谁" | 低,但结论要标注口径 |
| C 档:无 API | 元宝、夸克 AI、部分手机厂商内置助手 | 只能人工或半自动采集 | 高,通常只能降到每题 10–30 次 |
这张表的实际用法:不要用同一个采样标准要求所有平台。A 档跑满 100 次报百分比和置信区间;C 档降到 10–30 次,只报"是否出现"和名单位次,不报百分比。把 C 档的低采样数字和 A 档放进同一张趋势图,是中文监测里最常见的自欺。
B 档的坑最隐蔽:API 版和 App 版是两个不同的产品。 联网检索开着的时候,答案主要由检索结果决定;关掉的时候,答案由训练语料决定。同一个问题,两种模式下的推荐名单可能完全不重合。报数时必须写清测的是哪一种,否则优化动作会打偏——针对训练语料的动作(铺第三方内容、等模型更新)和针对检索的动作(改官网可抓取性、抢搜索结果前排)几乎没有交集。
不同平台背后拉的是哪一层信源,决定了投入方向。国产 AI 的三层信源栈地图按底层搜索引擎、自有生态、知识库拆了这三层;具体到单个平台,元宝的搜狗、公众号、腾讯新闻三条信源通道是一个可直接照抄的样本。
怎么搭一套可复现的监测流程:五个步骤
按顺序执行,每一步的产出都是下一步的输入。
- 建问题集。 30–80 个真实用户问法,按 5:3:2 配比:五成品类需求词("小团队用什么…比较合适"),三成对比词("A 和 B 哪个更适合…"),两成品牌词("XX 这家怎么样")。品类词测发现,对比词测竞争,品牌词测口碑准确性。
- 选平台。 按目标用户实际在用的助手排序,不是按知名度排。预算有限时先覆盖 3 个主力平台,按行业用户分布确定监测优先级比平均撒网划算得多。
- 跑基线。 优化动作全部暂停,连续采集两周作为基线。没有基线,后面所有归因都是猜。
- 打标。 每条回答记录五个字段:是否提及、名单位次、是否引用本站、情感倾向、事实是否有误。位次和引用建议人工抽检 10% 校准,纯自动打标在中文语境下误判率不低——中文品牌名与通用词重合("飞书""有数""明道")、简称与全称混用、竞品名被顺带提到却被正则算成提及,都是常见的误判来源。
- 定复盘节奏。 周度看波动,月度看趋势,季度调问题集。单周下跌不行动,连续两周下跌才启动排查。
流程本身不复杂,难在纪律——变量控制住了,数据才有解释力。
提及率上不去时,按这条路径排查
先定位问题在哪一层,再动手,顺序反了会白做很多工作。
第一步:查抓取。 AI 平台的爬虫能不能访问你的站点。检查 robots.txt 是否拦了 GPTBot、PerplexityBot、ClaudeBot 等 UA,各家爬虫的标识可在 OpenAI 官方的爬虫说明文档 中核对。这是最常见也最容易修的一层。
第二步:查渲染。 内容是否靠前端 JS 才能出现。大量 AI 抓取不执行 JavaScript,纯客户端渲染的页面在它们眼里可能接近空白。
第三步:查信源。 AI 的回答不一定来自你的官网。国产模型往往优先调用自有生态与底层搜索引擎的内容,官网只是其中一环。想验证某个平台到底在读哪一层,可以做信源反查:把 AI 回答里出现的具体表述(价格区间、成立年份、案例客户名)拿去各平台原文搜索,看它复述的是谁家的文案——通义千问推荐品牌时在读阿里系内容吗用的就是这个验证路径。海外平台则更依赖百科、垂直媒体和社区讨论。
第四步:查可引用性。 页面有内容、也被抓了,但没有一段能被直接摘出来当答案。检查是否有 40–60 字的定义式段落、结论是否前置、参数是否成表——段落级可引用性的实测与写法给了可对照的改写样例。Google 在 AI 功能与你的网站官方文档 中明确表示,AI 功能沿用常规搜索的内容与索引规则,没有单独的"AI 排名"开关——可抓取、结构清晰、信息可核实仍是前提。
第五步:查竞品。 你没变,但对手发了一批被 AI 采信的内容。此时该看的是答案份额而非提及率,前者才反映相对位置。
排查顺序不能颠倒。 第一、二层是二元问题,几小时能查清、几天能修好;第三、四层是内容工程,周期以月计。跳过前两层直接改内容,等于在一个爬虫进不来的站点上精雕细琢。
从 AI 可见性到真实流量:归因怎么做
可见性是先行指标,流量和转化才是结果指标,两者之间需要一条能对上的链路。
GA4 默认渠道分组至今没有独立的 AI 类别,来自 ChatGPT、Perplexity 等的访问被混在 "Referral" 里,和普通外链堆在一起。可行做法是建自定义渠道组,用来源正则匹配 chatgpt|perplexity|claude|gemini|copilot|doubao|kimi 之类的模式,并把该分组排在 Referral 之前——GA4 按首个命中的规则归类,顺序错了就前功尽弃。
要注意一个测不到的黑洞:Google AI Overviews 带来的点击仍被计为普通自然搜索,无法与传统自然流量分离。这部分只能靠"展示量涨、点击率跌"的组合信号间接推断。
中文侧还有一层更硬的墙:大量国产 AI 助手在 App 内打开链接,referrer 直接丢失,访问落进"直接流量"。可行的替代信号有两条:一是给可能被 AI 引用的落地页加短链或独立路径,靠路径而非 referrer 归因;二是盯品牌词搜索量的变化——AI 推荐往往不带走点击,而是让用户回头去搜品牌名,这部分增量在自然搜索的品牌词里。
服务器日志是另一条更硬的证据链。按 UA 统计各家 AI 爬虫的抓取频次与抓取路径,能直接看出它们在读你的哪些页面——被反复抓取的目录,通常就是后续被引用的候选池。这条链路的价值在于它是唯一不依赖采样的观测:日志是全量的,不需要算置信区间。
工具怎么选:自建脚本还是商用平台
先看规模。每天需要跑的采样量 = 问题数 × 平台数 × 每题采样次数,50 题 × 4 平台 × 30 次 = 6000 次调用/天。这个量级决定了成本结构和技术路线。
| 维度 | 自建脚本 | 商用监测平台 |
|---|---|---|
| 启动成本 | 低,但需工程投入 | 订阅费,开箱即用 |
| 平台覆盖 | 受限于有 API 的模型 | 通常含无 API 的助手 |
| 打标质量 | 需自己训练与校准 | 内置,但口径未必透明 |
| 历史数据 | 完全自有可迁移 | 视厂商导出能力 |
| 适合谁 | 单一品类、问题集稳定 | 多品牌多地区、需要竞品对照 |
选型时问供应商四个具体问题,比看功能列表有用:
- 每题采样几次? 低于 30 次的百分比不必看。很多平台默认每题只跑 1–3 次,报出来的曲线全是噪声。
- 位次和引用怎么判定? 正则还是模型判定,人工抽检准确率多少。
- 无 API 平台的数据是怎么来的? 前端抓取还是人工采集,多久采一次。这决定了中文平台覆盖的真实成色。
- 历史原始数据能否导出? 不能导出意味着换供应商就得从头积累基线。
想横向了解各类产品的能力边界,可以看这份AI 搜索品牌监控工具的选型对照;如果监测之外还要打通内容生产与投放,AI 搜索营销工具推荐清单覆盖了完整链路上的工具分工。
30 天冷启动排期
从零开始,第一个月这样排,第 31 天你会有一份可信的基线报告。
- 第 1–3 天:搭问题集(30–80 题),定平台清单并按 A/B/C 档标注采样上限,确认打标字段。
- 第 4–5 天:跑通采集管道,做一次小规模试采(每题 10 次)验证脚本与打标逻辑。
- 第 6–19 天:基线期。停止一切 GEO 优化动作,A 档平台每题采满 30 次以上,隔天一采。
- 第 20–21 天:出基线报告,四层指标各出一个数,标出置信区间;C 档平台只出"是否出现"。
- 第 22–30 天:只做第一层修复(抓取与渲染),这类改动因果清晰,不污染基线。
- 第 31 天起:进入优化—监测循环,每两周评估一次,差异不超过阈值不下结论。
最容易犯的错是基线期忍不住动手。前两周多改一次内容,后面三个月的归因就多一个说不清的变量。
若已有几百篇存量内容想同步启动改造,别等基线跑完再动——排期第 22–30 天可以并行做筛选,AEO 引用潜力打分与批量筛选方法给了打分维度。
常见问题
问:多久测一次比较合适?
基线期隔天一采,稳定后每周一采即可。日更没有意义——日间波动主要是采样噪声,除非模型刚发版或你刚上线了大批内容。
问:提及率多少算及格?
没有通用及格线。品类词提及率的合理区间取决于赛道集中度:头部品牌垄断的赛道,第三名能拿到 15% 就不错;长尾细分赛道,做对了可以到 60% 以上。看答案份额比看绝对值靠谱,它自带同赛道基准。
问:只被列在"参考来源"里算不算被看见?
算,但价值低一档。它证明你的内容被抓取和采信了,属于引用率而非首推率。转化贡献主要来自正文推荐名单,参考来源里的链接点击率通常很低。
问:模型版本更新导致数据断崖,怎么处理?
把它当作新基线的起点,不要和旧数据拉在同一条曲线上做同比。做法是:在时间轴上标注版本变更点,变更前后各自重跑一次基线(各题 30 次以上),此后只在同版本区间内做前后对比。跨版本的涨跌无法归因到你的优化动作。
问:AI 写的内容会不会影响引用表现?
决定因素是内容质量与信息独特性,不是生产方式。缺乏原创信息、结构松散的内容无论谁写都难被引用,具体的实测表现和踩坑边界见AIGC 内容的实际引用表现。
问:奖项和认证要不要写进页面,AI 会当证据吗?
会,但写法决定成败。带颁发机构、年份、可核验链接的表述容易被当作事实采信;"行业领先""屡获殊荣"这类无主语的形容词会被直接跳过。奖项、认证和专利的写法有具体对照。
问:小团队没预算做完整监测怎么办?
砍采样次数不如砍问题数。保留 10 个最核心的问题、2 个主力平台,每题采满 30 次,得到的是可信的小样本;铺 100 题但每题只问 1 次,得到的是一堆无法解释的数字。
