公开方法论
GEO 方法论:怎么审一个站在 AI 答案里的可见性
传统 SEO 问的是「我排第几」。答案引擎不排名——它检索少数几个来源,合成一个答案。一个站可以稳居第一页顶部,却从不被引用。这套方法论审的是后一件事。
下面四个阶段、prompt 集、爬虫矩阵和可引用性清单全部公开,免注册可读,你可以自己照着跑。
最后更新:2026-09-07
四个阶段,按顺序跑
不要跳过第 1 阶段。没有引用基线,后面所有结论都是猜的。
- 阶段 1
引用基线
用 10–15 条真实买家会打的问句跑一遍,记录品牌是否被点名、是否带链接、引的是自有域还是第三方,以及竞品出现的顺序。产出提及率、带链引用率、声量占比三个数。
- 阶段 2
爬虫可达性
逐个解析 robots.txt 对下面每个 agent 的裁决。一行 robots 规则的杀伤力大过任何内容功夫——这一阶段的发现优先级高于其他所有项。
- 阶段 3
内容可引用性
挑三个最想被引的页面,按下面的清单逐条判。检索器取的是段落不是整页——判据是「这 200–300 字单独拎出来还成不成立」。
- 阶段 4
引用来源分布
统计答案实际引了哪些域:自有站、评测站、论坛帖、榜单文。这决定下一步该投内容还是投第三方渠道。
买家意图 prompt 集(阶段 1)
凑 10–15 条真实买家会打的问句,四种意图都要覆盖。全是品类问句的集合会高估你的可见性。
| 意图 | 句式 | 示例 |
|---|---|---|
| 品类 | "best X for Y" | best expense tools for seed-stage startups |
| 比较 | "A vs B" | Ramp vs Brex for a 30-person team |
| 替代 | "alternatives to A" | alternatives to Expensify |
| 问题 | 只描述症状,不点名品牌 | how do I stop chasing receipts from my team |
每条 prompt 记四件事:品牌有没有被点名;是带链引用还是仅在正文提及;引用指向哪个域(自有站还是评测站、论坛、榜单等第三方);出现了哪些竞品、顺序如何。产出提及率、带链引用率、声量占比三个数。
AI 爬虫矩阵(阶段 2)
完全不出现在 AI 答案里,最常见的原因是一次意外封禁——而多数团队封掉的那个 agent,恰恰不是控制引用的那个。逐个 agent 按标准 robots.txt 匹配规则裁决:点名该 agent 的最具体 User-agent 组胜出,只有在没有任何组点名它时 * 才生效;组内最长匹配路径胜出,等长时 Allow 压过 Disallow。
| Agent | 运营方 | 用途 | 封掉它的实际代价 |
|---|---|---|---|
OAI-SearchBot | OpenAI | 搜索索引 | ChatGPT Search 里的引用 |
ChatGPT-User | OpenAI | 对话中实时抓取 | 用户问到你的页面时模型打不开它 |
GPTBot | OpenAI | 训练 | 模型背景知识,不影响搜索引用 |
PerplexityBot | Perplexity | 搜索索引 | Perplexity 引用 |
Perplexity-User | Perplexity | 查询中实时抓取 | 实时读页 |
ClaudeBot | Anthropic | 索引与训练 | Anthropic 侧检索 |
Googlebot | 主索引 | AI Overviews 与 AI Mode,外加常规搜索 | |
Google-Extended | Gemini grounding 与训练 | 仅 Gemini grounding —— 不影响 AI Overviews | |
Bingbot | Microsoft | Bing 索引 | 吃 Bing 索引的 Microsoft Copilot |
Applebot | Apple | 索引 | Apple 搜索面 |
Applebot-Extended | Apple | 训练 | 仅 Apple Intelligence 训练 |
CCBot | Common Crawl | 开放抓取语料 | 众多下游模型的输入之一 |
报告里每个 agent 一行,写明裁决(ALLOWED / BLOCKED / PARTIAL)、责任规则、影响。责任规则必须逐字引用 robots.txt 里那一行,或写「无匹配规则,默认允许」——不要在没有责任行的情况下下裁决。
可引用性清单(阶段 3)
挑三个最想被引的页面,逐条判下面这些属性——它们决定一个段落会不会被抬进答案里。
- 自足段落
- 检索器取的是块不是页。任意 200–300 字单独引用,脱离上下文还能不能读懂。
- 答案前置
- 开头写定位话术的页会被跳过。答案应该出现在标题下的第一段。
- 问句式小标题
- 把小标题写成用户真会问的那句话,匹配检索的效果远好过写得巧妙的标题。
- 具体量
- 数字、日期、写明的上限、价格是可引的。「业界领先的性能」不是。
- 第一手证据
- 原始数据、实测、写明方法的结论能扛过摘要压缩。复述常识扛不过。
- 新鲜度信号
- 可见的最后更新日期,以及内容本身确实是当期的。
- 结构化数据
- Organization、Product、FAQPage、Article。要验证它能解析——能渲染不等于能通过校验。
这套方法论的边界
- 一次运行是快照,不是趋势。
- 答案引擎持续重排,同一个 prompt 隔几小时就可能给出不同来源。要让数字有意义,必须冻结 prompt 集、按固定周期重跑、每次都记录。
- 别把没测过的数说成测过的。
- 抓不到的页面本身就是一条发现,不是拿猜测去填的空白。
- 爬虫名字会变。
- 定稿前对着每个运营方自己公布的爬虫文档核一遍新增和改名,并写明你用的是哪一版清单。
常见问题
- 这套方法论要付费或注册才能用吗?
- 不用。本页把 prompt 集、爬虫矩阵和可引用性清单完整公开,免注册可读,你完全可以自己按它跑一遍。
- GEO / AEO 和传统 SEO 有什么区别?
- 传统 SEO 争的是排名,答案引擎不排名——它检索少数几个来源合成一个答案。一个站可以稳居第一页顶部却从不被引用。这套方法论审的是后一件事。
- 排名不高还有必要做吗?
- 有,而且这正是窗口所在。公开研究显示,AI 答案引用的 URL 与自然搜索结果的重合度很低,大部分被引来源并不在自然结果前三。被引不以先排到前三为前提。
- 封掉 AI 爬虫是不是更安全?
- 取决于你的立场,而且要分开看:放行搜索类爬虫是被引用的前提,放行训练类爬虫影响模型背景知识但不影响引用,两个决定互相独立。有内容授权诉求的出版方和想被 AI 推荐的公司会落在不同位置,都合理。
谁在维护这套方法论
MaxAEO 做的是 AI 答案引擎可见性。上面这套 prompt 集、爬虫矩阵和可引用性清单,就是我们自己产品跑的那一套,公开在这里,免注册可读。同一套方法论也打包成了 ChatGPT 插件与 Claude / Codex 可用的开源技能,可以在你自己的助手里直接跑。
一次运行只是快照。要把它变成可比较的数字,需要冻结 prompt 集、按固定周期跨引擎重跑并留存历史——这是手工做起来最费的部分,也是我们产品在做的部分。
