搜索排名与AI引用的关系,是过去一年被误读最多的一组数据。有人拿 76% 的重合率证明「SEO 照做就行」,也有人拿 38% 的新数字宣布「排名已死」。两个数字都是真的,冲突来自统计口径——而口径差异里,恰好藏着最可操作的答案。
先给结论:排名决定的不是「会不会被引用」,而是「被引用得有多显眼」。 高显著度的引用位强烈偏向前 10 名,长尾引用位则大量来自排名之外。这两件事必须分开算预算。
搜索排名和 AI引用到底是什么关系?
搜索排名与AI引用是「强相关、非充分、非必要」的关系:排名越高越容易被引,但排第一不保证被引,没排名也不等于不会被引。 三项公开研究的数字看似打架,把口径摊开就一致了。
| 研究方 | 时间 | 统计口径 | 样本规模 | 前 10 名重合率 |
|---|---|---|---|---|
| Ahrefs | 2025年7月 | 只统计每条回答中最显眼的前 3 个引用 | 100 万条 AI 概览 / 190 万条引用 | 76.1% |
| seoClarity | 2025年10月 | 全部引用,对照前 20 名 | 36.2 万查询 / 510 万条引用 | 约 41%(推算) |
| Ahrefs | 2026年3月 | 全部引用,解析方法升级 | 86.3 万关键词 / 400 万 URL | 38% |
规律很清楚:你统计的引用越完整,相关性看起来就越弱。 Ahrefs 对 100 万条 AI 概览、190 万条引用的分析只看前 3 个显眼引用,所以得到 76%;同一家在 2026 年 3 月改用全量口径后降到 38%,Search Engine Journal 对这次口径变化的报道也明确指出两次数据集不可直接比较。
推算过程可以自己验:seoClarity 对 36.2 万个查询、510 万条引用的重合度研究显示 56% 的引用来自前 20 名,其中 32% 来自 1–3 名、41% 来自 4–10 名、27% 来自 11–20 名。前 10 名占前 20 名的 73%,56% × 73% ≈ 41%——正好落在 76% 和 38% 之间,三份数据互相印证而非互相否定。
同一份 Ahrefs 数据还给出一个被忽略的细节:AI 回答里第 1 个引用的自然排名中位数是第 2 名,第 2 个引用是第 4 名,第 3 个引用是第 5 名。这就是「排名买的是位置不是入场券」最直接的证据。

排到第几名,被引概率有多高?
从第 1 名到第 10 名,被引概率只从约 58% 降到约 38%——是缓坡,不是悬崖。 Originality.ai 按排名位置拆解的引用概率数据给出了目前颗粒度最细的一条曲线(统计范围限定在进入前 100 名的页面)。
| 自然排名 | 被引用概率 |
|---|---|
| 第 1 名 | 57.91% |
| 第 2 名 | 53.81% |
| 第 3 名 | 50.08% |
| 第 5 名 | 45.66% |
| 第 10 名 | 38.09% |
| 第 20 名 | 28.28% |
| 第 30 名 | 21.47% |
| 第 50 名 | 13.78% |
把这条曲线换算成「每一段排名提升买到多少引用概率」,会得到一个和传统 SEO 直觉相反的结论:
| 排名提升 | 概率变化 | 绝对提升 | 相对提升 |
|---|---|---|---|
| 50 → 30 | 13.78% → 21.47% | +7.7pp | +56% |
| 30 → 20 | 21.47% → 28.28% | +6.8pp | +32% |
| 20 → 10 | 28.28% → 38.09% | +9.8pp | +35% |
| 10 → 5 | 38.09% → 45.66% | +7.6pp | +20% |
| 5 → 3 | 45.66% → 50.08% | +4.4pp | +10% |
| 3 → 1 | 50.08% → 57.91% | +7.8pp | +16% |
边际收益最高的区间是 50→30 和 20→10,而不是 3→1。 传统 SEO 里第 1 名的点击率通常是第 3 名的两到三倍,所以「冲第一」值得砸重金;但在 AI引用的语境下,把一批第 20–50 名的页面推进前 10,回报明显高于把一个第 3 名推到第 1。
再叠上成本,差距会更大。 把第 3 名推到第 1 通常要动外链和品牌权重,周期以季度计;把第 30 名推到前 10 多数时候是页面级改造——补齐子问题、把答案提到首屏、加一张对比表。我们在客户站上的常规排期是:同样一个内容季度,1 个头部词的攻坚预算,够改 8–12 个第 20–50 名的存量页。前者概率净增 7.8pp,后者按平均 +8pp 计算,覆盖面差了一个数量级。
这条判断直接改选题排期:先扫存量页,再定新增页。 优先做「有一定基础但没进首页」的页面,而不是死磕头部词。
为什么相关性在一年内看起来变弱了?
主因是 query fan-out,把「一个问题」变成了「十几个子问题」。 AI 搜索接到一条查询后,会拆成 8–12 条甚至更多的子查询并行检索,再合成答案。你排名第一的那个词,可能根本不是它实际检索的词。
举个具体的:用户问「MaxAEO 和竞品哪个适合中小企业」,实际拆出的子查询往往是「MaxAEO 定价」「AEO 工具对比」「中小企业 SEO 预算多少」「AEO 和 SEO 区别」这类。你在「AEO 工具」这个主词上排第一,对上面四条一条都不占。
这意味着一个页面被引用,靠的是它在某条子问题上的可检索性,而不是在原始查询上的名次。Zyppy 汇总 54 项研究得出的 AI 引用因子权重表里,「Fan-out Rank(在相关子查询上的排名)」拿到 9.3 分,几乎和「Search Rank」的 9.4 分持平;而域名权重只有 5.0 分,内容长度 6.7 分且证据自相矛盾。
所以不是排名不重要了,是「排名的题目变多了」。 一个主词排第 30 但在十几条子问题上都排前 5 的页面,实际引用表现会好过一个主词排第 1、其余全空的页面。
反推自己的 fan-out 清单,最省事的办法是问模型本身。 把目标问句丢给 DeepSeek 或豆包的联网模式,追问一句「你为回答这个问题实际检索了哪些子问题」,多数模型会给出接近真实的拆解列表。跑 20 条主问句,就能拿到一张 100+ 条的子问题表——这张表比关键词工具导出的词库更贴近 AI 的实际检索行为。
中文 AI 平台不能直接套用 Google 数据
因为国内五大平台的语料池差异极大,同一条曲线在豆包和文心一言上完全不是一个斜率。 上面所有研究测的都是 Google AI 概览,直接搬到 DeepSeek 或豆包上会得出错误预算。
下表为业内公开估算与监测中反复出现的方向,属于结构性判断而非精确测量值,用来定优先级、不用来定 KPI:
| 平台 | 主力语料 | 与百度自然排名的相关性 | 实操含义 |
|---|---|---|---|
| 文心一言 | 百度百科、百度知道、百家号 | 强 | 百度系资产几乎直接决定结果 |
| DeepSeek | 媒体报道、知乎等 UGC、官网 | 中 | 通稿与问答权重高于官网自述 |
| 通义千问 | 新闻媒体为主 | 中 | 新闻源建设优先于站内优化 |
| 豆包 | 抖音、头条、抖音百科等字节生态 | 弱 | 站外资产比百度排名重要得多 |
| 腾讯元宝 | 微信公众号约占一半 | 很弱 | 微信生态内闭环,站外几乎无关 |
对豆包和元宝这类闭环平台,「提升百度排名」这个动作的边际效用接近于零——抖音内容进豆包和字节 AI 搜索的打法和网页 SEO 是两条完全独立的链路。文心一言方向则相反,百度百科与维基词条的建设方式直接决定它答什么。知乎类 UGC 在多个平台的权重都偏高,值得单独拆开看——知乎回答在 DeepSeek 和豆包里的可验证引用信号和网页排名走的是两套逻辑。
预算分配的落点是:先按平台权重排优先级,再决定站内还是站外。 目标客群主要在字节或微信生态的品牌,站外资产的优先级应当高于百度排名;反之则相反。站外 AEO 资产的平台优先级排法给的是一套按行业分的排序方法。
5 类排名很差却被高频引用的内容
这 5 类内容能绕开排名曲线,是因为它们要么不在百度索引的竞技场里,要么在 fan-out 的子问题上占位。
- 平台闭环 UGC——知乎回答、抖音口播文案、公众号长文。它们常常进不了百度前 100 名甚至不被收录,却是对应 AI 平台的一等语料。排名归零、引用率极高,是最典型的例外。
- 定义与术语页——fan-out 拆出的子问题中,「X 是什么」占比极大。一个主词排第 40 的术语表,在十几条定义类子问题上可能排前 3。术语表页在定义类问题上的引用红利正来自这个机制。
- 结构化对比页与参数表——表格提取成本最低,模型几乎不需要改写就能直接引用。写给「X 和 Y 哪个好」的竞品对比页哪怕商业词排名平平,也常出现在对比类回答里。
- 官方文档、白皮书与 PDF——PDF 在传统排名里天然吃亏(内链少、体验差),但「权威来源 + 具体数字」正是模型偏好的组合。Zyppy 的因子表里「Factually Specific」得 8.3 分、「Cites Sources」得 8.0 分。
- 长尾新问题内容——新出现的问题检索池小、竞争者少。一篇发布两周、排名还没起来的内容,可能是该子问题下唯一可用来源。
共同点只有一个:它们把答案做成了可以整段搬走的独立片段。 排名是分发渠道,可摘录性才是被选中的原因。
反过来:排名第一却不被引用的三种情况
排名很好但 AI 里查无此人,通常不是权重问题,而是页面根本没给出可提取的答案。 三种情况最常见:
- 答案埋得太深。模型对单个 URL 有检索长度上限,「Answer Near Top」在因子表里得 8.8 分。答案在第 8 屏,等于没有。
- 排名的是转化页不是答案页。品牌词第一名往往是定价页或注册页,通篇是按钮和卖点,没有一段能被独立引用的事实陈述。
- 技术层被挡住。
nosnippet、robots 限制、纯 JS 渲染,三者任一都会让页面在 AI 侧消失。「URL Accessibility」9.5 分、「Preview Control」9.2 分,是整张因子表里最高的两项。
技术层这一条最容易自查:nosnippet 和 max-snippet 由 Google 官方的 robots meta 标签文档定义,把页面源码里的 robots meta 和 HTTP 头的 X-Robots-Tag 都搜一遍,再用禁用 JS 的浏览器打开一次——正文消失就说明模型也读不到。这类脱节的完整诊断路径,可以对照搜索强势品牌的 AI 脱节排查方法逐项走一遍。
怎么自己测:排名—引用配对测试的 6 步方法
公开研究给的是行业平均值,你的行业曲线大概率不一样。用下面这套配对方法跑一次,成本约半天:
- 选题:挑 30–50 条真实商业问句(「XX 品牌怎么样」「XX 和 YY 哪个好」),不是关键词,是完整问句。
- 双记录:同一条问句,一边记录百度/必应前 20 名的 URL 列表,一边记录 DeepSeek、豆包、Kimi、通义千问联网模式下答案里的引用 URL 列表。
- 算重合:分子是两边都出现的 URL 数,分母是 AI 引用的 URL 总数,得到你的重合率。
- 分段:把引用 URL 按 1–3 名 / 4–10 名 / 11–20 名 / 20 名后 / 未排名 五档归类,画出你自己的概率曲线。
- 归因:给「未排名却被引用」的 URL 逐条打内容类型标签,对照上面 5 类例外,看你缺哪一类。
- 定预算:曲线在 1–10 段陡峭 → 排名投入有效;曲线平坦且「未排名」占比超过三成 → 预算应转向站外资产。
三个坑会让结果直接失真,务必避开:
- 别用同一个浏览器连续问。对话上下文会污染检索,每条问句开新会话,账号登录状态也保持一致。
- 别把域名当 URL 记。同域不同页算不同命中,按域名归并会把重合率虚高一二十个百分点。
- 别只跑一遍。同一问句连问三次,AI 引用列表往往不完全相同;取三次并集,否则会把随机波动当成结论。
每 4–6 周重跑一次。 模型版本、知识截止和检索策略都在变,三个月前的曲线不能拿来定这个季度的预算。

传统 SEO 还要不要做:按预算分三档
要做,但角色变了——从「拿流量」变成「进检索池」。 排名不再是终点,而是让页面有资格出现在模型的候选集里;进池之后能不能被选中,取决于可提取性。按预算给三档配置:
| 预算档位 | 排名投入占比 | 优先动作 |
|---|---|---|
| 紧张 | 20%–30% | 只做技术可抓取性 + 把答案提到首屏;其余投知乎、公众号等闭环 UGC |
| 中等 | 40%–50% | 集中推 20–50 名的存量页进前 10(边际回报最高段)+ 补术语表与对比页 |
| 充足 | 50%–60% | 加做 fan-out 子问题覆盖,一个主题拆 10 条子问题分别建页 |
三档都不建议低于 20%:技术可抓取性是所有 AI 引用的前置条件,被 nosnippet 或 JS 渲染挡住的页面,站外资产做得再好也补不回自己的官网露出。
判断依据只有一条:先测出你自己的曲线,再分钱。
常见问题
排名进不了前 10,还有必要做 SEO 吗?
有。第 20 名到第 10 名这一段的引用概率相对提升约 35%,是整条曲线上回报最高的区间之一,比从第 3 名冲到第 1 名(+16%)更划算。
排名第 1 就一定会被 AI 引用吗?
不一定。行业数据显示第 1 名的被引概率约 58%,即超过四成的情况下第 1 名不被引用。常见原因是答案位置太深、页面是转化页、或被 nosnippet 与 JS 渲染挡住。
为什么不同报告的重合率差距那么大?
统计口径不同。只统计最显眼的前 3 个引用会得到约 76%,统计全部引用会得到 38%–41%。看数据前先确认口径,否则会做出完全相反的预算决策。
国内平台也遵循这条曲线吗?
方向一致,斜率差异很大。文心一言与百度排名强相关,豆包和腾讯元宝几乎不相关,需要按平台单独测量而不是套用 Google 数据。
完全没有排名的新站,能被 AI 引用吗?
能,但路径不同。新站在主词上没有竞争力,可行的是走长尾新问题和定义类内容——检索池小、竞争者少,一篇发布两周的内容可能是某条子问题下唯一可用来源。同时优先建站外资产,不要等排名起来再动。
多久重测一次比较合适?
建议 4–6 周一次。模型迭代、知识截止时间和检索策略变化都会改变曲线形状,季度级的决策不应基于三个月前的样本。
