AI引用可信度信号实测:28万次查询下的四类权重排序

AI引用可信度信号四类权重对照实验的净提升柱状图,新鲜度最高、作者信号最低

AI引用可信度信号的真实权重不是四类平权。我们用 28 万次跨平台查询做了一次单变量对照实验,结果是:内容新鲜度净提升 7.8 个百分点,搜索排名 6.1,结构化数据 2.4,作者署名 1.3

更反直觉的一点在后面——四类信号全做,只拿回 11.4 个百分点,是单独值加总的 65%。这意味着"能加的信号都加上"是一种昂贵的错误。下面是完整的实验设计、分层结果和按页面状态查表的优先级决策。

什么是 AI引用可信度信号

AI引用可信度信号,指 AI 搜索判断一个页面值不值得写进答案时所依赖的可验证证据:内容时效、检索位置、结构可解析性、作者身份与外部佐证。

它不是一个信号,而是一组。下表是完整分类,以及本次实验的覆盖范围:

信号类别 页面上的具体表现 本次实验
内容时效 正文实质更新、dateModified、版本记录 ✅ D 组
检索位置 目标词自然排名、是否进入首页结果集 ✅ C 组
结构可解析性 定义句、参数表、步骤列表、Article schema ✅ B 组
作者身份 实名署名、独立作者页、资历、跨平台一致 ✅ A 组
外部佐证 第三方提及、行业目录、被他站引用 ❌ 未纳入
原创归属 首发时间、canonical、被搬运后的归属判定 ❌ 未纳入

区别在这里:传统 SEO 的终点是进入结果列表,AEO 优化的终点是被写进那段答案。一个页面可以稳定排在第 1 位却从不被引用,也可以排在第 12 位却频繁出现在 DeepSeek 品牌推荐的来源里。两套排序逻辑并不重合。 来源类型的完整划分与证据链诊断方法,见 AI 引用来源优化指南

现有研究漏掉了什么

学术侧已经有了扎实的结论,但它们绕开了品牌方最想问的两个问题。

SIGIR ’26 收录的 《What Gets Cited: Competitive GEO in AI Answer Engines》(Vishwakarma 等,2026)用双文档 RAG 测试台跑了 25.2 万次试验,覆盖 6 个模型、18 个内容因子。结论是主题相关性和上下文位置是最大驱动力;"近期时间戳 vs 旧时间戳"在全部六个模型上都是决定性因子(论文因准分离将其记为 OR >10k);而纯排版层面的改动几乎没有影响(Structured vs Dense OR 0.79–1.68)。

但那 18 个因子里,没有作者资历、没有 Schema 标记、没有真实网页的搜索排名——测试台是人工注入的两篇候选文档,绕过了检索环节。

另一篇 GEO 领域的批判性综述(Olivier Martinez,2026 年 7 月)则给出两条限定:对"权威语气"的支持"弱且不稳定",并直接警告 "Do not conflate confidence with evidence"(不要把自信当成证据);对文档结构的评价是"中等且异质性强"——"结构化字段可能改善检索,但未必在重排与引用阶段产生同样效果",应逐阶段验证,而不是当成万能护身符。

所以缺口很明确:没有人在真实的中文 AI 搜索环境里,对这四类 AI引用可信度信号做过单变量隔离测试。 这就是这次实验要补的位置。

实验怎么做:28 万次查询的单变量对照设计

实验周期为 2026 年 2 月 23 日至 6 月 21 日,共 17 周,其中前 4 周为基线期。平台覆盖 DeepSeek、豆包、Kimi、通义千问四家的联网检索模式,纯参数化记忆问答不计入。

分组与样本

样本为 230 篇内容页,分布在 42 个域名、4 个行业(B2B SaaS、企业服务、消费电子、家居消费品)。入选条件:已被主流搜索引擎收录、正文 800 字以上、过去 6 个月未做过改版或迁移。分组按域名分层随机,避免同一站点集中在同一组:

  • A 组 作者信号(40 篇):实名署名 + 独立作者页 + Person schema + 跨平台身份一致
  • B 组 结构化数据(40 篇):补全 Article/BlogPosting、author、datePublished/dateModified、面包屑
  • C 组 搜索排名(40 篇):内外链与标题改写,推进目标词自然排名
  • D 组 新鲜度(40 篇):正文实质更新 ≥30% + 同步 dateModified + 重新提交
  • E 组 对照(40 篇):不做任何改动
  • F 组 组合(30 篇):四类信号按顺序分四阶段叠加,每阶段间隔 3 周

每篇页面配 6 条真实用户问法(4 条信息型 + 2 条比较型),共 1380 条 prompt,每条每周在 4 个平台各跑 3 次独立会话,累计约 28.1 万次查询。

指标定义与噪声带

引用率 = 该域名出现在回答引用来源中的会话数 ÷ 总会话数。对照组基线 18.4%、观察期末 18.9%,漂移 +0.5pp,据此把噪声带定为 ±1.2pp——低于这个幅度的变化不作为有效结论。

单变量隔离在真实站点上并不完美:C 组改标题会触发重抓,可能顺带影响新鲜度信号。处理办法是冻结 C 组的 dateModified 并只在非正文区域改动,把交叉污染压到最低。这条限制在读结果时要一直记着。

AI引用可信度信号四类权重对照实验的净提升柱状图,新鲜度最高、作者信号最低

四类信号的权重实测结果

净提升 = 观察期末引用率 − 基线引用率 − 对照组漂移(0.5pp)。单变量组观察期为 6 周。

信号类别 样本 基线引用率 观察期末 净提升
新鲜度 40 篇 18.5% 26.8% +7.8pp
搜索排名 40 篇 18.7% 25.3% +6.1pp
结构化数据 40 篇 18.3% 21.2% +2.4pp
作者信号 40 篇 18.9% 20.7% +1.3pp
对照组 40 篇 18.4% 18.9% +0.5pp

作者信号的 +1.3pp 只比噪声带高出 0.1pp,整体上属于压线结论,单独看不足以支撑投入。但拆开看,它的分布极不均匀——后面会讲到。

排序本身和 SIGIR 论文的方向一致:时效与位置类信号是门槛,信任线索的增益偏小。但真正有用的信息藏在分层里,不在均值里。

新鲜度:见效最快,但有半衰期

新鲜度是四类信号里唯一能在两周内看到明确回报的,也是唯一会自己衰减的。把新鲜度组的观察期延长到 13 周后,曲线是这样的:

更新后周数 净提升
第 2 周 +9.4pp(峰值)
第 4 周 +8.6pp
第 6 周 +7.8pp
第 9 周 +5.1pp
第 13 周 +3.3pp

半衰期约 10 周。 这条曲线直接决定内容翻新的排期节奏——季度一轮刚好卡在收益跌破一半的位置,再慢就等于让前一轮投入白白衰减掉。

新鲜度信号引用率随时间衰减的曲线图,第2周达到峰值后逐周回落

四个平台的重抓延迟差多少

从内容更新到该平台回答中出现新版本内容,中位延迟差异很大:

平台 中位延迟 90 分位
豆包 6 天 14 天
Kimi 9 天 19 天
DeepSeek 11 天 23 天
通义千问 13 天 27 天

实操含义:更新后不到 14 天就判定"没效果",等于漏掉一半平台。 豆包能最快反映改动,通义千问最慢——做 A/B 判断时,观察窗口至少要盖到最慢平台的 90 分位。

只改 dateModified 不改正文,等于没改

新鲜度组里有 12 篇做了对照子测试:只更新 dateModified 和 Article schema 里的日期,正文一字不动。结果是 +0.8pp,落在噪声带内

这和 SIGIR 论文并不冲突:论文测的是"近期时间戳 vs 旧时间戳",两边的内容本身有差异;而我们测的是"同一篇内容改个日期"。时间戳只是索引线索,模型比对的是内容本身是否变了。刷日期这条捷径已经失效。

搜索排名:进前十是门槛,前十内继续爬收益很小

搜索排名的 +6.1pp 均值掩盖了一个阶梯结构。按排名区间拆开:

排名区间变化 样本 引用率净变化
21 名以后 → 11–20 名 10 篇 +0.6pp(噪声带内)
11–20 名 → 4–10 名 20 篇 +10.9pp
4–10 名 → 1–3 名 10 篇 +2.1pp

收益几乎全部集中在跨过第 10 名这条线的那一跳。从 20 名爬到 11 名不产生可测收益,从第 5 名爬到第 2 名也只有 2.1pp。

原因在检索环节:多数中文 AI 平台的联网检索抓取的是首页结果集,进不去这个集合就没有被引用的机会;进去之后,选谁由内容特征决定,位置的边际作用迅速衰减。排名已经很好却始终不被引用的诊断路径,见搜索强势品牌的 AI 脱节诊断

结论很直接:把排名从 15 名推到 8 名值得投;从 5 名推到 2 名,不值得为 AI 可见度单独投。

结构化数据:它是放大器,不是发动机

结构化数据的 +2.4pp 是四类里最容易被误读的一个数字。按页面本身是否已有可摘录结构拆开后,差距是 11 倍:

页面类型 样本 净提升
已有定义句 / 参数表 / 步骤列表 20 篇 +4.4pp
纯叙事型页面 20 篇 +0.4pp(噪声带内)

Schema 不创造可引用性,它只是让已经存在的可引用结构更容易被解析。 给一篇没有明确答案块的叙事文章加 Article schema,等于给空盒子贴标签。这也和综述里"结构化字段可能改善检索、未必改善引用"的判断对得上。

这还解释了行业里流传的一个可疑结论——"FAQPage schema 是最强的单一引用预测因子"。相关性可能是真的,因果方向却反了:会写 FAQ 结构的页面,本来就有一问一答的可摘录块。

时间点上也要更新认知:Google 已于 2026 年 5 月 7 日起不再展示 FAQ 富媒体搜索结果,并将在随后几个月里移除对应的搜索外观筛选、富媒体报告与测试工具支持(见 Google 官方 FAQPage 结构化数据文档)。注意区分两件事:SERP 展示形态没了,但 FAQPage 仍是有效的 Schema.org 类型,Google 仍会解析它来理解页面。 所以该保留就保留,只是别再把预算压在"抢富媒体位"上。

作者信号:只在"该信谁"的问题上被调用

作者信号的整体值压线,但按 prompt 类型拆开,出现了实验中最干净的一组反差:

Prompt 类型 占比 净提升
选型 / 推荐 / "哪个好" 1/3 +4.3pp
事实查询 / 参数确认 2/3 −0.2pp

模型只在需要判断"这个观点该信谁"的时候,才去调用作者可信度。 问"某型号的续航是多少",它不关心谁写的;问"这几款怎么选",署名和资历开始起作用。

这解释了为什么作者实体建设的评价一直两极分化——测的 prompt 类型不同,结论就相反。这也和综述里"权威语气效果弱且不稳定"的判断并不矛盾:语气不等于身份,可验证的作者实体才是信号。 落地方法可参考作者身份与专家资历的对照实测

四类叠加为什么只兑现 65%

组合组(30 篇)按新鲜度 → 排名 → 结构化数据 → 作者的顺序分四阶段叠加,每阶段间隔 3 周,得到这条边际收益曲线:

叠加阶段 累计净提升 本阶段边际 单独实测值 兑现率
仅新鲜度 +7.8pp +7.8pp +7.8pp 100%
+ 搜索排名 +10.1pp +2.3pp +6.1pp 38%
+ 结构化数据 +11.0pp +0.9pp +2.4pp 38%
+ 作者信号 +11.4pp +0.4pp +1.3pp 31%

单独值加总 17.6pp,组合实测 11.4pp,整体兑现率 65%。第一类信号就吃掉了总收益的 68%,第四类只剩 0.4pp。

原因是这四类信号在模型侧共享同一个判断维度——它们都在回答"这一页可不可信",而不是各自打开一个独立通道。 一旦某一类把页面推过了可信阈值,其余信号只能提供冗余确认。

这是"堆信号"策略最贵的盲区:预算按四份花,回报按一份多一点收。 Princeton 团队在 KDD 2024 的 GEO 论文中报告过系统性优化最高 40% 的可见度提升,那个上限同样是组合效果,不是各项相加。

实验没测、但不该忽略的三类信号

本次实验只隔离了四类页面内信号。下面三类同属 AI引用可信度信号,但需要跨站或跨时间观测,无法用单变量设计干净地测出来——不代表它们不重要:

  1. 外部佐证:被行业媒体、目录、问答社区提及的密度。它影响的是模型对"这个品牌是不是这个领域的常见答案"的先验判断,作用点在检索之前,不在页面之内。
  2. 原创归属:同一篇内容被多站转载时,模型未必把功劳记给首发方。首发时间、canonical、站内引用网络决定归属判定——具体建法见原创归属信号怎么建
  3. 可核验的事实颗粒:SIGIR 论文里除时效与相关性外,另一个跨模型稳定生效的因子是明确标价。推广开说,具体数字(价格、参数、版本号、生效日期)比形容词更容易被摘录进答案——这一点与我们"结构化数据只是放大器"的结论方向一致:可引用性来自内容本身有没有硬信息。

按页面状态决策,而不是按信号排名

优先级不该是一张全局排序表,而应该是按页面当前状态查表。把净提升除以每篇的投入人天,效率排序会和均值排序完全不同:

信号(限定适用场景) 净提升 每篇人天 效率(pp/人天)
结构化数据(页面已有结构块) +4.4pp 0.3 14.7
新鲜度(正文实质更新) +7.8pp 1.5 5.2
搜索排名(目标词在 11–20 名) +10.9pp 5.0 2.2
作者信号(选型/推荐类页面) +4.3pp 3.0 1.4

作者信号的 3 人天是摊销值,包含作者页与跨平台身份建设的一次性投入,分摊到该作者名下页面。

按这个顺序判断:

  1. 页面已有定义句、参数表或步骤列表,但缺 Article schema → 先补 schema,0.3 人天换 4.4pp
  2. 页面超过 6 个月未实质更新 → 做内容翻新,正文改动量要够,别只动日期
  3. 目标词自然排名在 11–20 名 → 投排名,这是唯一有大跳跃的区间
  4. 页面属于"怎么选 / 哪个好 / 推荐"类 → 建作者实体
  5. 目标词排名在 21 名之后 → 这四类信号都不要碰,先解决主题相关性和覆盖度

第 5 条最容易被忽略。相关性是检索环节的前置门槛,SIGIR 论文里主题是否匹配的 OR 高达 10000 以上——不进候选集,可信度信号无从谈起。完整的证据网络搭建路径见 7 步搭建 AI 引用与品牌提及证据网络

四个中文AI平台从内容更新到重新抓取的中位延迟对比图

上线前的七步诊断清单

改动之前按顺序过一遍,可以避免大部分无效投入:

  1. 确认抓取可达:AI 爬虫 UA 未被 robots.txt 或 WAF 拦截,页面无 nosnippet
  2. 确认目标词排名区间:21 名之后先做相关性,不做信号
  3. 确认页面有可摘录块:至少一个 40–60 字的定义段或一张参数表
  4. 核对 dateModified 与正文变更同步:只改日期不改内容会被识别为无效更新
  5. 核对 Article schema 字段与正文一致:schema 里写的作者、日期必须在页面上肉眼可见
  6. 核对作者实体跨平台一致:同名同职称同简介,姓名拼写与头衔不要有变体
  7. 建立引用率基线:至少 4 周、每条 prompt 每周 3 次,才能把噪声带算出来

第 7 步是前提。没有基线就没有归因,改动之后的所有波动都无法区分是自己的效果还是平台侧变化。

这份实验的边界

结论有明确的适用范围,需要说清楚:

  • 只覆盖联网检索模式。模型不触发检索、直接用参数化记忆回答时,这四类信号都不参与。
  • 只覆盖 4 个行业。B2C 快消、医疗与金融未纳入。YMYL 类目的可信度权重结构大概率不同,且需要更审慎的来源标准。
  • 平台侧变量无法完全控制。实验期内模型迭代、检索策略调整都可能发生;对照组用于扣除整体漂移,但无法消除单平台的结构性变化。
  • 作者信号的整体结论是压线的。+1.3pp 只高出噪声带 0.1pp,我们更信任它的分层结果(选型类 +4.3pp),而非均值。
  • 叠加顺序会影响边际曲线形状。组合组按效率降序叠加;若换成升序,前几段的边际值会更高、总值不变。

这些边界不影响主结论:信号之间高度重叠、收益快速递减,先做一类做透,比四类都做一半划算。

常见问题

只改 dateModified 真的完全没用吗?

在我们的 12 篇子样本里净提升 +0.8pp,落在 ±1.2pp 的噪声带内,无法判定为有效。日期字段仍需保留并保持准确——它是解析线索,只是不能替代内容更新本身。

作者信号既然整体这么弱,还值得投吗?

取决于页面类型。做评测、选型、推荐类内容值得投(+4.3pp);做参数查询、技术文档类内容不值得。判断标准只有一句话:这个问题的答案是否依赖"谁说的"。

为什么排名从第 5 推到第 2 只有 2.1pp?

因为检索环节抓取的是首页结果集,进入集合后位置的边际作用迅速衰减。选谁引用由内容特征决定,不再由位置决定。

AI引用可信度信号和 E-E-A-T 是一回事吗?

四个平台的信号权重一样吗?

四类信号的排序方向在四个平台上一致,但见效时间差异明显:豆包中位重抓延迟 6 天,通义千问 13 天,90 分位从 14 天拉到 27 天。同一个改动在豆包上两周内可见,在通义千问上可能要等一个月。做归因时按最慢平台设窗口。

多久重测一次比较合适?

建议按季度。新鲜度信号的半衰期约 10 周,与季度周期基本吻合;平台侧的检索策略调整通常也在这个尺度上发生,季度重测能同时捕捉两类变化。

这套方法能直接用在自己站上吗?

可以,但必须先建基线。至少 4 周、每条 prompt 每周 3 次跨平台采样,把自己的噪声带算出来。没有噪声带,任何小于 2pp 的变化都不该被当作结论。

{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@type": "Article",
      "headline": "AI引用可信度信号实测:作者、结构化数据、排名、新鲜度的权重排序",
      "description": "基于28万次跨平台查询的单变量对照实验,量化作者、结构化数据、搜索排名、内容新鲜度四类AI引用可信度信号的实际权重,给出边际收益曲线与优先级决策表。",
      "image": "image-placeholder",
      "author": {
        "@type": "Organization",
        "name": "MaxAEO"
      },
      "publisher": {
        "@type": "Organization",
        "name": "MaxAEO"
      },
      "datePublished": "",
      "dateModified": "",
      "inLanguage": "zh-CN",
      "articleSection": "AI搜索优化",
      "keywords": "AI引用 可信度信号, AI引用可信度信号, 内容新鲜度, 结构化数据, 作者署名, GEO优化, AEO优化",
      "citation": [
        {
          "@type": "ScholarlyArticle",
          "name": "What Gets Cited: Competitive GEO in AI Answer Engines",
          "url": "https://arxiv.org/abs/2605.25517"
        },
        {
          "@type": "ScholarlyArticle",
          "name": "Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)",
          "url": "https://arxiv.org/abs/2607.14035"
        },
        {
          "@type": "ScholarlyArticle",
          "name": "GEO: Generative Engine Optimization",
          "url": "https://dl.acm.org/doi/10.1145/3637528.3671900"
        }
      ]
    },
    {
      "@type": "FAQPage",
      "inLanguage": "zh-CN",
      "mainEntity": [
        {
          "@type": "Question",
          "name": "只改 dateModified 真的完全没用吗?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "在12篇子样本里净提升+0.8pp,落在±1.2pp的噪声带内,无法判定为有效。日期字段仍需保留并保持准确——它是解析线索,但不能替代内容更新本身。"
          }
        },
        {
          "@type": "Question",
          "name": "作者信号既然整体这么弱,还值得投吗?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "取决于页面类型。评测、选型、推荐类内容值得投(+4.3pp);参数查询、技术文档类内容不值得。判断标准是:这个问题的答案是否依赖谁说的。"
          }
        },
        {
          "@type": "Question",
          "name": "为什么排名从第5推到第2只有2.1pp?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "因为检索环节抓取的是首页结果集,进入集合后位置的边际作用迅速衰减,选谁引用由内容特征决定,不再由位置决定。"
          }
        },
        {
          "@type": "Question",
          "name": "AI引用可信度信号和E-E-A-T是一回事吗?",
          "acceptedAnswer": {
            "@type": "Answer",
          }
        },
        {
          "@type": "Question",
          "name": "四个平台的信号权重一样吗?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "四类信号的排序方向在四个平台一致,但见效时间差异明显:豆包中位重抓延迟6天,通义千问13天,90分位从14天拉到27天。做归因时应按最慢平台设置观察窗口。"
          }
        },
        {
          "@type": "Question",
          "name": "多久重测一次比较合适?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "建议按季度。新鲜度信号的半衰期约10周,与季度周期吻合;平台侧检索策略调整通常也在这个尺度上发生,季度重测能同时捕捉两类变化。"
          }
        },
        {
          "@type": "Question",
          "name": "这套方法能直接用在自己站上吗?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "可以,但必须先建基线:至少4周、每条prompt每周3次跨平台采样,算出自己的噪声带。没有噪声带,任何小于2pp的变化都不该被当作结论。"
          }
        }
      ]
    }
  ]
}