AEO 成熟度模型:五级自测、评分公式与 30 天改进清单

AEO 成熟度五级模型评分表截图

AEO 成熟度是品牌在 AI 答案引擎中被正确识别、可信引用、正向推荐并持续修正的能力等级,用来判断当前短板和下一步投入重点。

用户搜索“AEO 成熟度”,通常不是想再看一遍“AEO 是什么”,而是想解决三个问题:

  1. 我的品牌在 ChatGPT、Google AI Overviews、DeepSeek、豆包、Kimi、通义千问等 AI 搜索里处于什么阶段?
  2. 现在应该优先做技术索引、内容、Schema、第三方证据、公关,还是监测系统?
  3. 怎么把“AI 有没有提到我”变成可复测、可汇报、可持续优化的指标?

这篇文章给出 MaxAEO 使用的五级 AEO 成熟度模型:L0 不可见、L1 可识别、L2 被引用、L3 被推荐、L4 可治理。它不依赖单次截图,而是用 32 条提示词、多个平台、多次重复抽样,把 AI 提及率、推荐位、引用来源、情感、事实准确率和竞品表现放进同一张判断表。

AEO 成熟度五级模型评分表截图

AEO 成熟度到底衡量什么?

一个成熟的 AEO 体系至少包含四层能力:

能力层 要回答的问题 典型指标
可发现 AI 和搜索系统能不能抓到、索引、识别你的页面和实体? 索引状态、品牌名准确率、实体一致性
可理解 AI 是否知道你是谁、做什么、适合谁、不适合谁? 品牌解释准确率、产品事实错误率
可引用 AI 是否引用官网、媒体、评测、案例等可信来源支持答案? AI 引用来源、引用稳定性、来源可信度
可推荐 AI 是否在品类推荐、竞品对比、选型问题中把你列入短名单? AI 提及率、前 3 推荐位、推荐理由
可治理 团队能否持续监测、解释波动、修正错误并复盘投入产出? 月报、预警、负责人、修正周期

AEO 成熟度和 SEO 成熟度有什么区别?

对比项 SEO 成熟度 AEO 成熟度
核心目标 页面获得排名和点击 品牌进入 AI 答案、引用和推荐
主要对象 URL、关键词、SERP 品牌实体、答案片段、引用来源、推荐理由
评估方式 排名、CTR、流量、转化 提及率、推荐位、情感、引用可信度、事实准确率
常见短板 抓取、索引、内容覆盖、链接 实体模糊、证据不足、第三方缺席、AI 误读
汇报对象 SEO、内容、增长团队 市场、SEO、公关、产品、销售、管理层

自测前:先建立 32 条提示词基线

不要用一次 AI 回答判断品牌表现。可靠的 AEO 成熟度自测,至少要覆盖 8 类意图、32 条提示词、4 个平台,并在同一时间窗重复 3 次。

推荐基线样本:

意图类型 每类数量 示例问题
品类推荐 4 “适合中型电商品牌的 AI 搜索监控工具有哪些?”
品牌对比 4 “请比较品牌 A、品牌 B、品牌 C 的优缺点。”
预算选择 4 “预算有限时,品牌应该先做 SEO 还是 AEO?”
风险与缺点 4 “某类工具有哪些常见问题和限制?”
场景化购买 4 “跨境电商品牌如何监测 AI 推荐结果?”
替代品牌 4 “品牌 A 有哪些替代方案?”
售后与口碑 4 “用户通常怎么评价这类产品的服务质量?”
行业趋势 4 “未来 12 个月 AI 搜索优化会怎么变化?”

执行方法:

  1. 选 4 个目标平台,例如 Google AI Overviews/AI Mode、ChatGPT、DeepSeek、豆包、Kimi、通义千问中的 4 个。
  2. 每个平台跑同一组 32 条提示词。
  3. 每条提示词重复 3 次,间隔 5–15 分钟,记录回答差异。
  4. 一轮会得到 32 × 4 × 3 = 384 条回答样本,足够判断方向性问题。
  5. 所有测试固定在 24–48 小时内完成,避免平台更新、新闻事件和索引变化干扰。

记录时不要只截屏。每条回答至少提取 8 个字段:

字段 记录口径
是否提及 回答中是否出现品牌名、产品名或可识别别名
出现位置 第几个被提到;是否进入前 3
是否推荐 是否被明确列为推荐、首选、适合方案
推荐理由 AI 用什么理由解释推荐
情感倾向 正向、中性、负向;负向原因是什么
引用来源 官网、媒体、评测站、社区、文档、无引用
事实错误 公司名、价格、功能、适用场景、地区是否错误
竞品表现 同一回答里哪些竞品出现、排序如何

MaxAEO 在做 AEO 基线审计时,最常见的误判是:品牌看到“直接问品牌名时 AI 能回答”,就认为自己已经有 AI 可见性。实际更关键的是 不提品牌名的品类问题:用户问“有哪些工具/品牌/方案值得选”时,你是否进入候选,才决定 AEO 的商业价值。

五级 AEO 成熟度模型怎么打分?

AEO 成熟度用 100 分制评估:0–20 分为 L0 不可见,21–40 分为 L1 可识别,41–60 分为 L2 被引用,61–80 分为 L3 被推荐,81–100 分为 L4 可治理。

等级 分数 阶段定义 典型表现 下一步重点
L0 不可见 0–20 AI 无法稳定识别品牌实体 品类问题不出现;品牌名被写错;产品解释错误 建实体、索引、基础页面、Schema
L1 可识别 21–40 AI 能回答你是谁,但不主动推荐 直接问品牌能答;品类推荐和竞品对比缺席 补品类页、场景页、FAQ、对比内容
L2 被引用 41–60 AI 开始引用你或相关来源 官网、媒体、案例偶尔被引用;结果不稳定 提升可摘取性、证据密度、来源可信度
L3 被推荐 61–80 AI 在商业意图问题中推荐你 进入品类短名单;部分平台给出正向评价 做竞品差距、舆情修正、第三方证据
L4 可治理 81–100 结果可持续监测、解释和修正 多平台稳定推荐;事实准确;波动可复盘 建月报、预警、负责人和预算机制

推荐评分公式:

AEO 成熟度得分 = AI 提及率 × 25% + 推荐位得分 × 20% + 引用可信度 × 20% + 事实准确率 × 15% + 情感净值 × 10% + 竞品相对优势 × 10%

各指标口径如下:

指标 计算方法 为什么重要
AI 提及率 品牌被提及回答数 ÷ 总样本回答数 判断是否进入 AI 候选集合
推荐位得分 前 3 出现率、首位出现率加权 判断是否有商业推荐价值
引用可信度 高可信来源引用数 ÷ 总引用数 判断答案是否有证据支撑
事实准确率 无关键事实错误回答数 ÷ 提及回答数 判断 AI 是否正确理解品牌
情感净值 正向回答占比 – 负向回答占比 判断提及是否带来正面影响
竞品相对优势 你的推荐位、理由、引用质量相对竞品得分 判断是否真的赢得选择场景

“引用可信度”不要只数链接数量。2026 年一项关于 GEO 引用的测量研究 From Citation Selection to Citation Absorption 分析了 602 个提示词、21,143 条搜索层引用和 23,745 条引用级特征,指出“被选为引用”和“真正影响答案内容”并不是一回事。对品牌来说,被 AI 引用不等于被 AI 采纳;更重要的是页面里的定义、数据、对比和步骤是否进入最终答案。

AI搜索排名与AI提及率监测仪表盘截图

L0 到 L1:先让 AI 认出你是谁

L0 的核心问题不是排名低,而是 AI 没有稳定的品牌实体可识别。

常见症状:

  • AI 把你的品牌和同名公司、旧产品、海外品牌混淆。
  • 直接问品牌名时,回答只给出模糊描述。
  • 品类推荐问题里完全不出现。
  • 官网页面能打开,但核心页面未被索引或内容主要由 JS 延迟渲染。
  • About、产品页、价格页、案例页缺少公司主体、产品对象、适用行业、服务地区等事实。

30 天动作:

  1. 建一个清晰的品牌实体页,写明公司主体、品牌名、产品名、服务对象、地区、联系方式。
  2. 重写核心产品页,优先写可验证事实:功能、限制、集成方式、适用行业、典型客户、替代方案。
  3. 检查品牌名、产品名、创始人、公司名在官网、社媒、媒体稿、招聘页、第三方目录中的一致性。
  4. 确保核心页面可抓取、可索引、可生成摘要。
  5. 为 Organization、Product、Article、FAQ 等页面添加合适的结构化数据。结构化数据不是 AI 推荐的保证,但能帮助搜索系统理解页面含义。具体可参考 MaxAEO 的 Schema 结构化数据优化指南

验收标准:

指标 L0 升 L1 目标
品牌名直问准确率 ≥90%
核心产品解释错误率 ≤10%
核心页面索引率 ≥80%
品牌实体混淆次数 明显下降

L1 到 L2:从“被认识”变成“可被引用”

L1 品牌已经能被 AI 识别,但缺少可摘取、可核验、可引用的内容证据。

这一阶段不要先堆文章数量,而是改造“AI 能拿来回答问题”的页面。每个核心页面都应包含三种内容块:

内容块 写法 示例
答案块 40–60 字直接回答问题 “AEO 成熟度用于评估品牌在 AI 搜索中的识别、引用、推荐和治理能力。”
证据块 数据、步骤、表格、案例、限制条件 “用 32 条提示词、4 平台、3 次重复形成 384 条样本。”
归因块 明确来源、日期、对象、方法 “样本来自同一时间窗,按提及、推荐位、引用、情感记录。”

优先改造这些页面:

  1. 品类定义页:解释品类、适用场景、常见误解。
  2. 选型指南:告诉用户如何判断方案是否适合。
  3. 竞品对比页:用表格比较功能、对象、价格区间、限制。
  4. 客户案例:写清行业、问题、使用方式、结果指标。
  5. 价格与预算页:解释成本结构、适合预算、不适合人群。
  6. FAQ 页面:覆盖购买前、使用中、风险、替代方案问题。

Pranjal Aggarwal 等人的 GEO: Generative Engine Optimization 研究报告称,在生成式答案中加入权威引用、统计数字和更清晰表达,可在其测试环境中提升内容可见性,最高提升可达 40%,但不同领域效果差异明显。对品牌内容团队的启发是:不要只写观点,要写 AI 可以引用的事实、边界和证据。

验收标准:

指标 L1 升 L2 目标
官网或品牌来源被引用率 ≥20%
AI 可摘取答案块数量 ≥30 个
事实错误率 ≤15%
无来源回答占比 下降

L2 到 L3:让 AI 在竞品旁边推荐你

L2 到 L3 的关键变化,是品牌不只被引用,还能在“推荐哪些品牌/工具/方案”这类高商业意图回答中进入短名单。

这一阶段要做竞品问题簇,而不是只测自己的品牌名。建议分三组:

问题组 示例 诊断目的
无品牌需求 “适合 B2B SaaS 的 AI 品牌监测工具有哪些?” 看你是否自然进入候选
竞品牵引 “除了竞品 A,还有哪些替代方案?” 看 AI 是否把你当作替代项
直接对比 “品牌 A、品牌 B、品牌 C 哪个更适合中型团队?” 看推荐理由和短板归因

如果你在 L2 卡住,通常不是官网文章不够多,而是证据链断了:

  • 第三方评测、行业榜单、社区讨论里没有你。
  • 客户案例没有行业、规模、指标,只写“提升效率”。
  • 媒体报道只讲融资、发布会,不讲产品能力和适用场景。
  • 产品文档和官网说法不一致。
  • 用户负面反馈没有回应,AI 把旧问题当成当前事实。

L3 的动作是补齐“AI 会相信的证据链”:客户案例、独立评测、行业报告、开发者文档、公开数据、产品更新记录和可核验的第三方页面。新闻稿不是无效,但只有当它包含可引用事实、被权威站点收录、进入 AI 检索来源时,才可能帮助 AEO。MaxAEO 的英文研究 Do Press Releases Still Work — for AI Citations? 专门拆解了新闻稿对 AI 引用的作用边界。

验收标准:

指标 L2 升 L3 目标
品类推荐提及率 ≥40%
前 3 推荐位出现率 ≥20%
竞品对比中正向理由数量 增加
负面归因可解释率 ≥80%

L3 到 L4:把 AEO 纳入经营治理

L4 不是所有提示词都排第一,而是品牌能持续监测、解释、修正和复盘 AI 搜索表现。

L4 的组织分工通常会从 SEO 团队扩展到多个部门:

团队 负责内容
SEO/内容 页面结构、可摘取内容、索引、内链、主题覆盖
公关 第三方来源、媒体口径、危机回应、行业声量
产品 功能事实、版本更新、产品限制、文档准确性
销售/客服 高频异议、用户反馈、竞品替代理由
法务/合规 错误陈述、风险表述、敏感行业声明
管理层 预算、负责人、月度目标、跨部门优先级

AEO 汇报不能只看“AI 流量增长了几倍”。Keisuke Watanabe 和 Kazuki Nakayashiki 在 2026 年的 AEO 自然实验研究 中指出,ChatGPT 推荐流量的原始增长会混入平台整体增长;其样本中总推荐流量增长 5.7 倍,但未处理页面也增长 3.5 倍,干预对照后的水平提升估计为 1.82 倍。结论是:AEO 报告必须区分平台红利和优化效果。

成熟月报建议固定为 5 页:

  1. 本月 AEO 总览:总分、等级、最大变化。
  2. 平台差异:哪些平台提升,哪些平台误读。
  3. 提示词簇变化:品类、对比、替代、风险问题分别如何变化。
  4. 引用来源变化:官网、媒体、评测、社区、文档的占比。
  5. 下月动作:负责人、交付物、验收指标、风险。

管理层不需要 200 张截图,需要知道哪里增长、哪里误报、哪里被竞品超越、下月投什么。可参考 MaxAEO 的 AEO 月报模板

验收标准:

指标 L3 升 L4 目标
月度 AEO 报告 固定输出
关键提示词波动解释率 ≥80%
事实错误修正周期 ≤30 天
负面情感处理流程 已建立
预算与负责人 明确

每个等级的 30 天动作清单

AEO 成熟度自测的价值,是把“应该做很多事”变成“当前只做最该做的事”。

当前等级 30 天优先级 交付物 验收指标
L0 不可见 建实体和索引底座 品牌实体页、产品页、基础 Schema、索引检查表 品牌名直问准确率 ≥90%
L1 可识别 补内容覆盖 32 条提示词库、品类页、场景页、FAQ 品类问题提及率 ≥20%
L2 被引用 增强证据和可摘取性 10–30 个答案块、案例数据、引用来源更新 官网或品牌来源被引用率提升
L3 被推荐 做竞品差距和情感修正 5 个竞品问题簇、第三方证据清单、负面归因修正 前 3 推荐位出现率提升
L4 可治理 建运营机制 月报、预警、负责人、复盘节奏 关键波动可解释、可追责

如果 AI 经常用“价格高、缺少案例、信息不透明”描述你的品牌,说明问题已经超出内容层,需要把 AI 舆情纳入治理。具体指标和修正流程可看 AI 品牌舆情监控怎么做

常见误判:这些不等于 AEO 成熟

误判 为什么不成立 正确看法
“直接问品牌名能回答,所以 AEO 已经不错” 用户更多会问品类、对比、替代方案 看无品牌提示词中的提及和推荐
“AI 引用了我一次,所以已经被认可” 单次引用可能随机,且未必影响最终答案 看多平台、多次重复的引用稳定性
“SEO 排名好,AEO 一定好” 排名页未必含有可摘取答案和品牌证据 同时评估页面、实体、引用和情感
“发新闻稿就能提升 AI 引用” 泛新闻稿缺少可验证事实时很难被采纳 发可引用事实、数据、案例和第三方证据
“做一个 llms.txt 就能解决 AEO” Google 官方说明其生成式搜索不需要特殊 AI 文件 优先做可抓取内容、实体清晰和高质量证据
“提示词越多越好” 无计划扩展会增加噪音和维护成本 先固定 32 条核心提示词,再按业务扩展

FAQ

AEO 成熟度高,是否代表 SEO 一定好?

不一定。SEO 是重要底座,但 AEO 还要求品牌实体清晰、答案可摘取、第三方来源可信、AI 情感稳定。一个网站可能传统搜索流量不错,却在 AI 推荐中被竞品替代。

新品牌能不能直接做到 L3?

可以,但通常要先聚焦细分场景。新品牌很难在大品类问题里立刻胜出,却可以在长尾购买场景中先获得提及,例如“预算有限的 B2B 团队怎么做 AI 品牌监测”或“跨境电商品牌如何监测豆包推荐结果”。

AEO 成熟度多久测一次?

基线阶段建议每月一次;进入 L3 后,核心提示词可以每周监测。重大产品发布、负面舆情、竞品融资、行业政策变化后,应临时加测一次。

是否每个平台都要监测?

不需要一开始全量铺开。先选用户真实会用的平台:B2B 和 SaaS 可优先看 Google、ChatGPT、DeepSeek、通义千问;消费品牌可增加豆包、Kimi、小红书搜索等场景。关键是同一提示词、同一时间窗、同一评分口径。

负面情感会影响 AEO 成熟度吗?

会。AI 提及率高但情感偏负,不能算成熟。若 AI 经常说品牌“价格高”“信息不透明”“缺少案例”,需要追踪这些判断来自官网、媒体、社区还是旧内容,并逐一修正来源。

AEO 成熟度达到 L4 后还需要继续优化吗?

需要。L4 只是说明品牌有治理能力,不代表结果永久稳定。AI 搜索结果会受平台模型、索引、新闻事件、竞品内容和用户讨论影响,成熟团队应持续监测、复盘和修正。

什么时候需要平台化监控?

当提示词超过 50 条、平台超过 3 个、竞品超过 5 个,手工截图就很难支撑决策。此时应使用平台持续追踪 AI 提及率、AI 搜索排名、情感、AI 引用来源和竞品表现,把 AEO 从临时项目变成月度运营。