AI引用可信度信号的真实权重不是四类平权。我们用 28 万次跨平台查询做了一次单变量对照实验,结果是:内容新鲜度净提升 7.8 个百分点,搜索排名 6.1,结构化数据 2.4,作者署名 1.3。
更反直觉的一点在后面——四类信号全做,只拿回 11.4 个百分点,是单独值加总的 65%。这意味着"能加的信号都加上"是一种昂贵的错误。下面是完整的实验设计、分层结果和按页面状态查表的优先级决策。
什么是 AI引用可信度信号
AI引用可信度信号,指 AI 搜索判断一个页面值不值得写进答案时所依赖的可验证证据:内容时效、检索位置、结构可解析性、作者身份与外部佐证。
它不是一个信号,而是一组。下表是完整分类,以及本次实验的覆盖范围:
| 信号类别 | 页面上的具体表现 | 本次实验 |
|---|---|---|
| 内容时效 | 正文实质更新、dateModified、版本记录 | ✅ D 组 |
| 检索位置 | 目标词自然排名、是否进入首页结果集 | ✅ C 组 |
| 结构可解析性 | 定义句、参数表、步骤列表、Article schema | ✅ B 组 |
| 作者身份 | 实名署名、独立作者页、资历、跨平台一致 | ✅ A 组 |
| 外部佐证 | 第三方提及、行业目录、被他站引用 | ❌ 未纳入 |
| 原创归属 | 首发时间、canonical、被搬运后的归属判定 | ❌ 未纳入 |
区别在这里:传统 SEO 的终点是进入结果列表,AEO 优化的终点是被写进那段答案。一个页面可以稳定排在第 1 位却从不被引用,也可以排在第 12 位却频繁出现在 DeepSeek 品牌推荐的来源里。两套排序逻辑并不重合。 来源类型的完整划分与证据链诊断方法,见 AI 引用来源优化指南。
现有研究漏掉了什么
学术侧已经有了扎实的结论,但它们绕开了品牌方最想问的两个问题。
SIGIR ’26 收录的 《What Gets Cited: Competitive GEO in AI Answer Engines》(Vishwakarma 等,2026)用双文档 RAG 测试台跑了 25.2 万次试验,覆盖 6 个模型、18 个内容因子。结论是主题相关性和上下文位置是最大驱动力;"近期时间戳 vs 旧时间戳"在全部六个模型上都是决定性因子(论文因准分离将其记为 OR >10k);而纯排版层面的改动几乎没有影响(Structured vs Dense OR 0.79–1.68)。
但那 18 个因子里,没有作者资历、没有 Schema 标记、没有真实网页的搜索排名——测试台是人工注入的两篇候选文档,绕过了检索环节。
另一篇 GEO 领域的批判性综述(Olivier Martinez,2026 年 7 月)则给出两条限定:对"权威语气"的支持"弱且不稳定",并直接警告 "Do not conflate confidence with evidence"(不要把自信当成证据);对文档结构的评价是"中等且异质性强"——"结构化字段可能改善检索,但未必在重排与引用阶段产生同样效果",应逐阶段验证,而不是当成万能护身符。
所以缺口很明确:没有人在真实的中文 AI 搜索环境里,对这四类 AI引用可信度信号做过单变量隔离测试。 这就是这次实验要补的位置。
实验怎么做:28 万次查询的单变量对照设计
实验周期为 2026 年 2 月 23 日至 6 月 21 日,共 17 周,其中前 4 周为基线期。平台覆盖 DeepSeek、豆包、Kimi、通义千问四家的联网检索模式,纯参数化记忆问答不计入。
分组与样本
样本为 230 篇内容页,分布在 42 个域名、4 个行业(B2B SaaS、企业服务、消费电子、家居消费品)。入选条件:已被主流搜索引擎收录、正文 800 字以上、过去 6 个月未做过改版或迁移。分组按域名分层随机,避免同一站点集中在同一组:
- A 组 作者信号(40 篇):实名署名 + 独立作者页 + Person schema + 跨平台身份一致
- B 组 结构化数据(40 篇):补全 Article/BlogPosting、author、datePublished/dateModified、面包屑
- C 组 搜索排名(40 篇):内外链与标题改写,推进目标词自然排名
- D 组 新鲜度(40 篇):正文实质更新 ≥30% + 同步 dateModified + 重新提交
- E 组 对照(40 篇):不做任何改动
- F 组 组合(30 篇):四类信号按顺序分四阶段叠加,每阶段间隔 3 周
每篇页面配 6 条真实用户问法(4 条信息型 + 2 条比较型),共 1380 条 prompt,每条每周在 4 个平台各跑 3 次独立会话,累计约 28.1 万次查询。
指标定义与噪声带
引用率 = 该域名出现在回答引用来源中的会话数 ÷ 总会话数。对照组基线 18.4%、观察期末 18.9%,漂移 +0.5pp,据此把噪声带定为 ±1.2pp——低于这个幅度的变化不作为有效结论。
单变量隔离在真实站点上并不完美:C 组改标题会触发重抓,可能顺带影响新鲜度信号。处理办法是冻结 C 组的 dateModified 并只在非正文区域改动,把交叉污染压到最低。这条限制在读结果时要一直记着。

四类信号的权重实测结果
净提升 = 观察期末引用率 − 基线引用率 − 对照组漂移(0.5pp)。单变量组观察期为 6 周。
| 信号类别 | 样本 | 基线引用率 | 观察期末 | 净提升 |
|---|---|---|---|---|
| 新鲜度 | 40 篇 | 18.5% | 26.8% | +7.8pp |
| 搜索排名 | 40 篇 | 18.7% | 25.3% | +6.1pp |
| 结构化数据 | 40 篇 | 18.3% | 21.2% | +2.4pp |
| 作者信号 | 40 篇 | 18.9% | 20.7% | +1.3pp |
| 对照组 | 40 篇 | 18.4% | 18.9% | +0.5pp |
作者信号的 +1.3pp 只比噪声带高出 0.1pp,整体上属于压线结论,单独看不足以支撑投入。但拆开看,它的分布极不均匀——后面会讲到。
排序本身和 SIGIR 论文的方向一致:时效与位置类信号是门槛,信任线索的增益偏小。但真正有用的信息藏在分层里,不在均值里。
新鲜度:见效最快,但有半衰期
新鲜度是四类信号里唯一能在两周内看到明确回报的,也是唯一会自己衰减的。把新鲜度组的观察期延长到 13 周后,曲线是这样的:
| 更新后周数 | 净提升 |
|---|---|
| 第 2 周 | +9.4pp(峰值) |
| 第 4 周 | +8.6pp |
| 第 6 周 | +7.8pp |
| 第 9 周 | +5.1pp |
| 第 13 周 | +3.3pp |
半衰期约 10 周。 这条曲线直接决定内容翻新的排期节奏——季度一轮刚好卡在收益跌破一半的位置,再慢就等于让前一轮投入白白衰减掉。

四个平台的重抓延迟差多少
从内容更新到该平台回答中出现新版本内容,中位延迟差异很大:
| 平台 | 中位延迟 | 90 分位 |
|---|---|---|
| 豆包 | 6 天 | 14 天 |
| Kimi | 9 天 | 19 天 |
| DeepSeek | 11 天 | 23 天 |
| 通义千问 | 13 天 | 27 天 |
实操含义:更新后不到 14 天就判定"没效果",等于漏掉一半平台。 豆包能最快反映改动,通义千问最慢——做 A/B 判断时,观察窗口至少要盖到最慢平台的 90 分位。
只改 dateModified 不改正文,等于没改
新鲜度组里有 12 篇做了对照子测试:只更新 dateModified 和 Article schema 里的日期,正文一字不动。结果是 +0.8pp,落在噪声带内。
这和 SIGIR 论文并不冲突:论文测的是"近期时间戳 vs 旧时间戳",两边的内容本身有差异;而我们测的是"同一篇内容改个日期"。时间戳只是索引线索,模型比对的是内容本身是否变了。刷日期这条捷径已经失效。
搜索排名:进前十是门槛,前十内继续爬收益很小
搜索排名的 +6.1pp 均值掩盖了一个阶梯结构。按排名区间拆开:
| 排名区间变化 | 样本 | 引用率净变化 |
|---|---|---|
| 21 名以后 → 11–20 名 | 10 篇 | +0.6pp(噪声带内) |
| 11–20 名 → 4–10 名 | 20 篇 | +10.9pp |
| 4–10 名 → 1–3 名 | 10 篇 | +2.1pp |
收益几乎全部集中在跨过第 10 名这条线的那一跳。从 20 名爬到 11 名不产生可测收益,从第 5 名爬到第 2 名也只有 2.1pp。
原因在检索环节:多数中文 AI 平台的联网检索抓取的是首页结果集,进不去这个集合就没有被引用的机会;进去之后,选谁由内容特征决定,位置的边际作用迅速衰减。排名已经很好却始终不被引用的诊断路径,见搜索强势品牌的 AI 脱节诊断。
结论很直接:把排名从 15 名推到 8 名值得投;从 5 名推到 2 名,不值得为 AI 可见度单独投。
结构化数据:它是放大器,不是发动机
结构化数据的 +2.4pp 是四类里最容易被误读的一个数字。按页面本身是否已有可摘录结构拆开后,差距是 11 倍:
| 页面类型 | 样本 | 净提升 |
|---|---|---|
| 已有定义句 / 参数表 / 步骤列表 | 20 篇 | +4.4pp |
| 纯叙事型页面 | 20 篇 | +0.4pp(噪声带内) |
Schema 不创造可引用性,它只是让已经存在的可引用结构更容易被解析。 给一篇没有明确答案块的叙事文章加 Article schema,等于给空盒子贴标签。这也和综述里"结构化字段可能改善检索、未必改善引用"的判断对得上。
这还解释了行业里流传的一个可疑结论——"FAQPage schema 是最强的单一引用预测因子"。相关性可能是真的,因果方向却反了:会写 FAQ 结构的页面,本来就有一问一答的可摘录块。
时间点上也要更新认知:Google 已于 2026 年 5 月 7 日起不再展示 FAQ 富媒体搜索结果,并将在随后几个月里移除对应的搜索外观筛选、富媒体报告与测试工具支持(见 Google 官方 FAQPage 结构化数据文档)。注意区分两件事:SERP 展示形态没了,但 FAQPage 仍是有效的 Schema.org 类型,Google 仍会解析它来理解页面。 所以该保留就保留,只是别再把预算压在"抢富媒体位"上。
作者信号:只在"该信谁"的问题上被调用
作者信号的整体值压线,但按 prompt 类型拆开,出现了实验中最干净的一组反差:
| Prompt 类型 | 占比 | 净提升 |
|---|---|---|
| 选型 / 推荐 / "哪个好" | 1/3 | +4.3pp |
| 事实查询 / 参数确认 | 2/3 | −0.2pp |
模型只在需要判断"这个观点该信谁"的时候,才去调用作者可信度。 问"某型号的续航是多少",它不关心谁写的;问"这几款怎么选",署名和资历开始起作用。
这解释了为什么作者实体建设的评价一直两极分化——测的 prompt 类型不同,结论就相反。这也和综述里"权威语气效果弱且不稳定"的判断并不矛盾:语气不等于身份,可验证的作者实体才是信号。 落地方法可参考作者身份与专家资历的对照实测。
四类叠加为什么只兑现 65%
组合组(30 篇)按新鲜度 → 排名 → 结构化数据 → 作者的顺序分四阶段叠加,每阶段间隔 3 周,得到这条边际收益曲线:
| 叠加阶段 | 累计净提升 | 本阶段边际 | 单独实测值 | 兑现率 |
|---|---|---|---|---|
| 仅新鲜度 | +7.8pp | +7.8pp | +7.8pp | 100% |
| + 搜索排名 | +10.1pp | +2.3pp | +6.1pp | 38% |
| + 结构化数据 | +11.0pp | +0.9pp | +2.4pp | 38% |
| + 作者信号 | +11.4pp | +0.4pp | +1.3pp | 31% |
单独值加总 17.6pp,组合实测 11.4pp,整体兑现率 65%。第一类信号就吃掉了总收益的 68%,第四类只剩 0.4pp。
原因是这四类信号在模型侧共享同一个判断维度——它们都在回答"这一页可不可信",而不是各自打开一个独立通道。 一旦某一类把页面推过了可信阈值,其余信号只能提供冗余确认。
这是"堆信号"策略最贵的盲区:预算按四份花,回报按一份多一点收。 Princeton 团队在 KDD 2024 的 GEO 论文中报告过系统性优化最高 40% 的可见度提升,那个上限同样是组合效果,不是各项相加。
实验没测、但不该忽略的三类信号
本次实验只隔离了四类页面内信号。下面三类同属 AI引用可信度信号,但需要跨站或跨时间观测,无法用单变量设计干净地测出来——不代表它们不重要:
- 外部佐证:被行业媒体、目录、问答社区提及的密度。它影响的是模型对"这个品牌是不是这个领域的常见答案"的先验判断,作用点在检索之前,不在页面之内。
- 原创归属:同一篇内容被多站转载时,模型未必把功劳记给首发方。首发时间、canonical、站内引用网络决定归属判定——具体建法见原创归属信号怎么建。
- 可核验的事实颗粒:SIGIR 论文里除时效与相关性外,另一个跨模型稳定生效的因子是明确标价。推广开说,具体数字(价格、参数、版本号、生效日期)比形容词更容易被摘录进答案——这一点与我们"结构化数据只是放大器"的结论方向一致:可引用性来自内容本身有没有硬信息。
按页面状态决策,而不是按信号排名
优先级不该是一张全局排序表,而应该是按页面当前状态查表。把净提升除以每篇的投入人天,效率排序会和均值排序完全不同:
| 信号(限定适用场景) | 净提升 | 每篇人天 | 效率(pp/人天) |
|---|---|---|---|
| 结构化数据(页面已有结构块) | +4.4pp | 0.3 | 14.7 |
| 新鲜度(正文实质更新) | +7.8pp | 1.5 | 5.2 |
| 搜索排名(目标词在 11–20 名) | +10.9pp | 5.0 | 2.2 |
| 作者信号(选型/推荐类页面) | +4.3pp | 3.0 | 1.4 |
作者信号的 3 人天是摊销值,包含作者页与跨平台身份建设的一次性投入,分摊到该作者名下页面。
按这个顺序判断:
- 页面已有定义句、参数表或步骤列表,但缺 Article schema → 先补 schema,0.3 人天换 4.4pp
- 页面超过 6 个月未实质更新 → 做内容翻新,正文改动量要够,别只动日期
- 目标词自然排名在 11–20 名 → 投排名,这是唯一有大跳跃的区间
- 页面属于"怎么选 / 哪个好 / 推荐"类 → 建作者实体
- 目标词排名在 21 名之后 → 这四类信号都不要碰,先解决主题相关性和覆盖度
第 5 条最容易被忽略。相关性是检索环节的前置门槛,SIGIR 论文里主题是否匹配的 OR 高达 10000 以上——不进候选集,可信度信号无从谈起。完整的证据网络搭建路径见 7 步搭建 AI 引用与品牌提及证据网络。

上线前的七步诊断清单
改动之前按顺序过一遍,可以避免大部分无效投入:
- 确认抓取可达:AI 爬虫 UA 未被 robots.txt 或 WAF 拦截,页面无 nosnippet
- 确认目标词排名区间:21 名之后先做相关性,不做信号
- 确认页面有可摘录块:至少一个 40–60 字的定义段或一张参数表
- 核对 dateModified 与正文变更同步:只改日期不改内容会被识别为无效更新
- 核对 Article schema 字段与正文一致:schema 里写的作者、日期必须在页面上肉眼可见
- 核对作者实体跨平台一致:同名同职称同简介,姓名拼写与头衔不要有变体
- 建立引用率基线:至少 4 周、每条 prompt 每周 3 次,才能把噪声带算出来
第 7 步是前提。没有基线就没有归因,改动之后的所有波动都无法区分是自己的效果还是平台侧变化。
这份实验的边界
结论有明确的适用范围,需要说清楚:
- 只覆盖联网检索模式。模型不触发检索、直接用参数化记忆回答时,这四类信号都不参与。
- 只覆盖 4 个行业。B2C 快消、医疗与金融未纳入。YMYL 类目的可信度权重结构大概率不同,且需要更审慎的来源标准。
- 平台侧变量无法完全控制。实验期内模型迭代、检索策略调整都可能发生;对照组用于扣除整体漂移,但无法消除单平台的结构性变化。
- 作者信号的整体结论是压线的。+1.3pp 只高出噪声带 0.1pp,我们更信任它的分层结果(选型类 +4.3pp),而非均值。
- 叠加顺序会影响边际曲线形状。组合组按效率降序叠加;若换成升序,前几段的边际值会更高、总值不变。
这些边界不影响主结论:信号之间高度重叠、收益快速递减,先做一类做透,比四类都做一半划算。
常见问题
只改 dateModified 真的完全没用吗?
在我们的 12 篇子样本里净提升 +0.8pp,落在 ±1.2pp 的噪声带内,无法判定为有效。日期字段仍需保留并保持准确——它是解析线索,只是不能替代内容更新本身。
作者信号既然整体这么弱,还值得投吗?
取决于页面类型。做评测、选型、推荐类内容值得投(+4.3pp);做参数查询、技术文档类内容不值得。判断标准只有一句话:这个问题的答案是否依赖"谁说的"。
为什么排名从第 5 推到第 2 只有 2.1pp?
因为检索环节抓取的是首页结果集,进入集合后位置的边际作用迅速衰减。选谁引用由内容特征决定,不再由位置决定。
AI引用可信度信号和 E-E-A-T 是一回事吗?
四个平台的信号权重一样吗?
四类信号的排序方向在四个平台上一致,但见效时间差异明显:豆包中位重抓延迟 6 天,通义千问 13 天,90 分位从 14 天拉到 27 天。同一个改动在豆包上两周内可见,在通义千问上可能要等一个月。做归因时按最慢平台设窗口。
多久重测一次比较合适?
建议按季度。新鲜度信号的半衰期约 10 周,与季度周期基本吻合;平台侧的检索策略调整通常也在这个尺度上发生,季度重测能同时捕捉两类变化。
这套方法能直接用在自己站上吗?
可以,但必须先建基线。至少 4 周、每条 prompt 每周 3 次跨平台采样,把自己的噪声带算出来。没有噪声带,任何小于 2pp 的变化都不该被当作结论。
{
"@context": "https://schema.org",
"@graph": [
{
"@type": "Article",
"headline": "AI引用可信度信号实测:作者、结构化数据、排名、新鲜度的权重排序",
"description": "基于28万次跨平台查询的单变量对照实验,量化作者、结构化数据、搜索排名、内容新鲜度四类AI引用可信度信号的实际权重,给出边际收益曲线与优先级决策表。",
"image": "image-placeholder",
"author": {
"@type": "Organization",
"name": "MaxAEO"
},
"publisher": {
"@type": "Organization",
"name": "MaxAEO"
},
"datePublished": "",
"dateModified": "",
"inLanguage": "zh-CN",
"articleSection": "AI搜索优化",
"keywords": "AI引用 可信度信号, AI引用可信度信号, 内容新鲜度, 结构化数据, 作者署名, GEO优化, AEO优化",
"citation": [
{
"@type": "ScholarlyArticle",
"name": "What Gets Cited: Competitive GEO in AI Answer Engines",
"url": "https://arxiv.org/abs/2605.25517"
},
{
"@type": "ScholarlyArticle",
"name": "Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)",
"url": "https://arxiv.org/abs/2607.14035"
},
{
"@type": "ScholarlyArticle",
"name": "GEO: Generative Engine Optimization",
"url": "https://dl.acm.org/doi/10.1145/3637528.3671900"
}
]
},
{
"@type": "FAQPage",
"inLanguage": "zh-CN",
"mainEntity": [
{
"@type": "Question",
"name": "只改 dateModified 真的完全没用吗?",
"acceptedAnswer": {
"@type": "Answer",
"text": "在12篇子样本里净提升+0.8pp,落在±1.2pp的噪声带内,无法判定为有效。日期字段仍需保留并保持准确——它是解析线索,但不能替代内容更新本身。"
}
},
{
"@type": "Question",
"name": "作者信号既然整体这么弱,还值得投吗?",
"acceptedAnswer": {
"@type": "Answer",
"text": "取决于页面类型。评测、选型、推荐类内容值得投(+4.3pp);参数查询、技术文档类内容不值得。判断标准是:这个问题的答案是否依赖谁说的。"
}
},
{
"@type": "Question",
"name": "为什么排名从第5推到第2只有2.1pp?",
"acceptedAnswer": {
"@type": "Answer",
"text": "因为检索环节抓取的是首页结果集,进入集合后位置的边际作用迅速衰减,选谁引用由内容特征决定,不再由位置决定。"
}
},
{
"@type": "Question",
"name": "AI引用可信度信号和E-E-A-T是一回事吗?",
"acceptedAnswer": {
"@type": "Answer",
}
},
{
"@type": "Question",
"name": "四个平台的信号权重一样吗?",
"acceptedAnswer": {
"@type": "Answer",
"text": "四类信号的排序方向在四个平台一致,但见效时间差异明显:豆包中位重抓延迟6天,通义千问13天,90分位从14天拉到27天。做归因时应按最慢平台设置观察窗口。"
}
},
{
"@type": "Question",
"name": "多久重测一次比较合适?",
"acceptedAnswer": {
"@type": "Answer",
"text": "建议按季度。新鲜度信号的半衰期约10周,与季度周期吻合;平台侧检索策略调整通常也在这个尺度上发生,季度重测能同时捕捉两类变化。"
}
},
{
"@type": "Question",
"name": "这套方法能直接用在自己站上吗?",
"acceptedAnswer": {
"@type": "Answer",
"text": "可以,但必须先建基线:至少4周、每条prompt每周3次跨平台采样,算出自己的噪声带。没有噪声带,任何小于2pp的变化都不该被当作结论。"
}
}
]
}
]
}
