GEO关键词研究是把传统搜索词扩展成用户在 AI 里真实说出的完整问句,再按答案重合度合并、按限制条件拆分、按可干预性舍弃,最终得到一张能落地监测的需求地图。 它的产出物不是关键词表,而是一份带优先级的问句清单。
不能沿用旧流程,是因为搜索框和对话框收到的输入不是一种东西。搜索框收到压缩过的名词短语,对话框收到带预算、带场景、带顾虑的一整句话。
这篇文章按实际执行顺序展开:先讲清差异与代价,再给四类输入源的采集方法、六种问法模板、三条量化筛选规则、四维打分表,最后是一个把 412 条压到 96 条的完整案例、五个常见错误和一份七天启动清单。
GEO关键词研究和传统关键词研究有什么区别
GEO关键词研究研究的是「用户会怎么完整地问」,传统关键词研究研究的是「用户会怎么简短地搜」。前者的成功标准是品牌出现在生成答案里并被引用,后者是页面排进结果页前列。
差异体现在五个维度:
| 对比维度 | 传统关键词研究 | GEO关键词研究 |
|---|---|---|
| 研究单位 | 2–6 字的关键词 | 15–60 字的完整问句 |
| 数据来源 | 搜索量、竞价难度、点击率 | AI 答案文本、引用来源、追问链 |
| 判重方式 | 词面相似、SERP 重合 | 答案品牌集合与引用来源重合 |
| 成功指标 | 排名位次、自然流量 | AI提及率、答案位次、引用占比 |
| 结果稳定性 | 同一词的结果日间波动小 | 同一问句重跑可能换掉一半品牌 |
关键分歧在最后一行。传统关键词的排名今天和明天差别不大,生成式答案每次重跑都可能重排,这直接决定了后面「哪些问句能当 KPI、哪些不能」的取舍逻辑。想先厘清 AEO 与 GEO 在概念层面的边界,可以参考 MaxAEO 对 AEO 与 GEO 差异的拆解。
关键词表直接搬进AI搜索会发生什么:一组实测数据
会失效,且失效程度比多数团队预估的大。 2026 年 5 月 12 日至 5 月 26 日,MaxAEO 团队做了一次内部对照测试:覆盖消费电子、家清个护、SaaS 工具、工业设备、教育培训、跨境电商 6 个行业,每个行业取 20 个有搜索量的种子关键词,共 120 个种子词。
我们把每个种子词扩展成完整问句,共 1,043 条,在 DeepSeek、豆包、Kimi、通义千问 4 个平台各跑 3 次(早、中、晚各一次),累计采集 12,516 次回答,逐条抽取答案中提到的品牌名和引用来源域名。
三个结果值得记下来:
- 种子词与完整问句的答案品牌集合,平均只有 34% 重合。「扫地机器人推荐」和「预算三千以内、家里有长毛猫,扫地机器人买哪个」在同一平台上给出的品牌名单,三分之二不一样。
- 有 217 条问句(20.8%)在三次重跑中品牌集合完全不稳定,每次的名单几乎不重叠。这类高波动问句可以监测,但不适合单独作为考核指标。
- 加限制条件会改变答案主体的比例:人群/体质类限制 71%、预算类 63%、使用场景类 58%、合规资质类 46%。
需要说明的是,这是一次自有样本测试,不是公开基准;平台模型更新后数值会漂移,各行业之间差异也不小。但方向足够明确:只监测种子词,等于放弃了三分之二的答案空间。
学界判断与之一致。Aggarwal 等人在 GEO: Generative Engine Optimization 论文(KDD 2024)中指出,针对生成式引擎的内容策略可将来源可见度提升最高约 40%,而其测评集 GEO-bench 本身由自然语言问句构成,不是关键词。

需求地图怎么搭:三层结构和四类输入源
需求地图是 GEO关键词研究的核心产出物,结构为三层:种子词 → 问题簇 → 问句变体。种子词继承自现有 SEO 关键词库,问题簇是同一动机下的一组问法,问句变体是真实用户可能说出的具体句子。
一个例子:种子词「智能门锁」→ 问题簇「租房场景选购」→ 变体「租的房子能装智能门锁吗,房东不同意怎么办」「租房装的智能门锁搬家能拆走吗」。
四类输入源决定这张地图的覆盖度,缺一类就留下盲区。四类的产出比例在我们的样本里大致是:传统搜索词 30%、客服销售记录 25%、AI 追问链 25%、竞品与社区 20%。
输入源一:传统搜索词与站内搜索日志
搜索词提供主题骨架,站内搜索提供用词习惯。重点看站内搜索里的零结果查询——用户用了自己的说法,而你的站点没有对应内容,这类词往往正是 AI 里的高频问法。
操作步骤:
- 导出近 90 天站内搜索词与 Search Console 查询(Search Console 单站点最多导出 1,000 行,按品类目录分段导出可拿到更全的长尾)。
- 按「是否含疑问词」「是否含限制条件」两列打标。
- 含限制条件的那批优先扩展成问句,零结果查询单列一张表,逐条判断是内容缺口还是命名差异。
输入源二:销售与客服记录里的客户异议
异议是最高价值也最容易被漏掉的输入源。客户在电话里问的「你们这个和某某比贵在哪」「售后是不是要寄回原厂」,几乎原封不动地出现在 AI 对话框里。
具体做法:抽取近 6 个月的工单与销售录音转写,按异议类型归类(价格、兼容性、售后、资质、替代方案),再把每类异议改写成用户视角的第一人称问句。改写时保留客户的原话用词,不要换成产品手册里的术语——用户在 AI 里也用大白话。
一条经验:工单里出现频次排前 20 的异议,在我们测试的样本中有 16 条能在至少一个 AI 平台的追问建议里找到近义问法。客服记录不是补充材料,是最接近真实问法的一手来源。
输入源三:AI 平台自身的追问链与相关问题
直接向 DeepSeek、豆包、Kimi、通义千问提出种子问句,记录它们生成的追问建议和相关问题模块。这些是平台自己对「用户接下来会问什么」的判断,等价于免费的意图扩展数据。
我们的测试里,4 个平台对同一种子问句给出的追问建议平均只有 1.8 条重合,把四个平台跑一遍能多拿到 2–3 倍的问句素材。
采集时注意两点:关掉登录态或用干净会话,否则历史对话会污染追问建议;固定时段采集,同一问句早晚跑出的追问链本身就有差异。
输入源四:竞品与行业信源里的对照问法
去看竞品的对比页、行业媒体的评测标题、垂直社区里的求助帖。对比类问法有自己的结构,按品牌、方案、场景、限制条件四条线展开会更完整。
这里有个反向用法:如果发现某条问句的答案里反复出现同一个来源不明、内容明显为投放而生的站点,先别急着模仿,那可能是被操纵的信源,处理方式见 AI 搜索被操纵的手法与防御。
B2B 品牌要额外补一条采购链:供应商初筛、技术评估、采购尽调三个阶段的问法完全不同,可以对照 B2B 企业围绕采购决策链搭建 GEO 内容的做法。
从关键词到问句:六种问法模板
把一个种子词扩成问句时,套模板比凭感觉列举更完整。以下六类覆盖了我们样本中 89% 的真实问句形态。
| 问法类型 | 句式模板 | 示例(种子词:净水器) |
|---|---|---|
| 选购决策 | 预算 X、场景 Y,选哪个 | 三口之家租房住,预算两千的净水器选哪种 |
| 品牌对比 | A 和 B 哪个更适合 Z | A 品牌和 B 品牌净水器,滤芯成本差多少 |
| 疑虑排除 | X 是不是真的会 Y | 净水器是不是把矿物质也滤掉了 |
| 操作指导 | 怎么做 X,需要注意什么 | 净水器滤芯多久换一次,自己能换吗 |
| 资质合规 | X 需要什么认证/标准 | 家用净水器要看哪些国家标准和检测报告 |
| 反向排除 | 什么情况下不该买 X | 什么样的家庭其实不需要装净水器 |
「反向排除」这一类最容易被漏。它在答案里往往触发平台给出「不推荐」清单,而品牌一旦被写进不推荐清单,负面影响远大于没被提及——这也是 AI 舆情监控需要覆盖问句层而不只是品牌词层的原因。
每个种子词用六类模板各扩 2–3 条,一个种子词能稳定产出 12–18 条问句。120 个种子词扩到 1,043 条,就是这么来的(去重后每个种子词平均剩 8.7 条)。
哪些问法该合并、拆分、舍弃:三条量化判定规则
问句扩到几百条之后,难点从「怎么想出来」变成「哪些值得留」。多数公开方法论到这里就停了,只给分类不给阈值。以下三条规则来自前述 1,043 条问句的重合度分析。
合并规则:引用来源域名重合度 ≥ 70% 就并成一条
判定依据:当两条问句在同一平台的答案中,引用来源域名重合度达到 70% 以上时,它们的品牌提及集合重合度中位数为 91%——监测两条和监测一条,结论几乎相同。
而当来源重合度低于 50% 时,品牌集合重合度中位数只有 29%,这两条问句实际上落在完全不同的答案空间里。
怎么算:取两条问句在同一平台三次重跑的引用域名并集,用 Jaccard 相似度(交集 ÷ 并集)。跨平台分别计算,只要有两个及以上平台超过 70% 就判合并。
操作上,合并后保留表述最自然、最接近口语的那一条作为代表句,其余作为同簇变体存档,不进 KPI 面板。这一步通常能把问句总量压掉 40%–60%。
拆分规则:限制条件改变答案主体就必须拆开
判定依据:加入限制条件后,如果答案里排名前三的品牌换掉两个或以上,说明这是一个独立的答案空间,必须单独监测。
按前面的实测数据,人群/体质类限制(71%)和预算类限制(63%)触发拆分的概率最高,应当优先展开;合规资质类(46%)可按行业酌情处理,医疗、金融、母婴等受监管品类必须拆。
一个反例:「学生党笔记本推荐」和「预算五千的笔记本推荐」看起来像同一簇,但前者的答案里会大量出现轻薄本和教育优惠,后者以性能本为主,前三名只剩一个重合——这就必须拆。
舍弃规则:品牌进不了答案候选集且无法干预的,先放弃
判定依据:连续两周、每周三次重跑,品牌及其官方内容从未出现在答案或引用来源中,同时该问句的引用来源被单一权威站点垄断(如国家标准全文公开系统、监管机构官网),则短期内不具备可干预性,移出主监测池。
注意「先放弃」不等于「永久删除」。这类问句应转入季度复核清单,因为平台信源结构会变。真正该永久删除的只有两类:与品类无关的泛问句,和明显由测试或爬虫产生的伪问句。
三条规则的执行顺序不能颠倒:先拆分,再合并,最后舍弃。先合并会把本该拆开的限制条件问句提前压掉,代表句一旦选错,后面整簇都跟着错。

问句优先级怎么打分:四维评分表
规则筛完之后仍会剩下上百条,需要打分排序。四个维度,每项 1–5 分,加权求和:
| 维度 | 权重 | 5 分 | 1 分 |
|---|---|---|---|
| 商业价值 | 35% | 选购决策、品牌对比类,临门一脚 | 纯科普、原理解释类 |
| 竞争缺口 | 30% | 竞品稳定被提及、你没有 | 你已稳定占位 |
| 可干预性 | 25% | 引用来源含自有站点或可投稿媒体 | 来源渠道全部封闭 |
| 复现稳定性 | 10% | 三次重跑品牌集合一致 | 三次全不一致 |
其中"大家都没被提及的空白问句"在竞争缺口一栏给 4 分——空白意味着入场成本低,但需求验证也弱,比确定的竞品缺口低一档。
分档处理:总分 ≥ 3.8 进入首批优化清单,2.5–3.8 进入观察池,低于 2.5 转季度复核。
搜索量在这套评分里刻意没有单独占一栏——AI 场景里大量高价值问句没有可查搜索量,判断依据要换成需求证据而非流量数据(客服工单频次、销售异议出现率、社区提问量、平台追问建议出现次数)。
采集与记录:这套研究需要哪些数据字段
问句池不是一张问句清单,是一张随时间累积的观测表。每条问句至少要记七个字段,缺任何一个都会让后面的合并、舍弃判定做不下去:
| 字段 | 用途 |
|---|---|
| 问句原文 | 唯一标识,保留口语表述 |
| 所属种子词 / 问题簇 | 回溯层级,支持按簇汇总 |
| 平台 | 分平台统计,不做跨平台平均 |
| 采集时间戳 | 判断波动与版本更新影响 |
| 答案中出现的品牌集合 | 合并与拆分判定的输入 |
| 引用来源域名列表 | 合并判定与可干预性判断的输入 |
| 品牌首次出现位置 | 答案位次,比"是否提及"更细 |
前两个字段靠人工维护,后五个必须自动化采集——手工跑四个平台每周三次、上百条问句,一轮就是上千次交互,人力成本决定了这件事只能靠工具做。选型时应重点验证数据来源是否可追溯到原始回答、历史数据能否导出,评估清单可以参考 AI 搜索监控工具的能力与证据核验方法;在正式采购前用两周做一次小范围验证,比看功能列表可靠得多,流程见 AI 搜索监控 POC 的两周验证方法。
一个消费电子品牌的落地案例:412 条问句压到 96 条之后
某清洁电器品牌(国内市场,年营收规模 5–10 亿)在 2026 年初做过一轮 GEO关键词研究。初始扩展得到 412 条问句,团队原本打算全量监测。
按上述三条规则处理后的结果:
| 处理环节 | 数量变化 | 说明 |
|---|---|---|
| 初始扩展 | 412 条 | 四类输入源合并去重后 |
| 拆分(限制条件触发) | +34 条 | 主要来自宠物家庭、地毯场景 |
| 合并(来源重合 ≥70%) | −187 条 | 压缩率 41.9% |
| 舍弃(不可干预) | −163 条 | 多为标准法规类和纯技术原理类 |
| 最终核心池 | 96 条 | 占初始量的 23.3% |
内容侧只针对这 96 条问句做了三件事:改写 12 篇产品页的场景化问答段落、补 5 篇针对宠物家庭和地毯场景的深度评测、把第三方检测报告的原文数据放进可抓取的页面正文。
三个月后(2026 年 2 月至 5 月),这 96 条核心问句上的加权 AI提及率从 18% 升至 41%,四个平台中豆包提升最明显(+29 个百分点),通义千问最慢(+12 个百分点)。同期未纳入核心池的问句提及率基本持平(+2 个百分点)。
需要保留的判断:这是单品牌单次实践,同期该品牌也在做常规内容更新和电商投放,无法完全排除外部因素;提升幅度不应当作行业基准。
这个对比里最有价值的不是提升幅度,而是那 163 条被舍弃的问句:如果全量投入,同样的内容预算会被摊薄到四倍的问句上,而其中大部分根本没有干预入口。GEO关键词研究真正省下来的成本,在于它明确告诉你哪些仗不该打。
问句池怎么和考核挂钩
这一步最容易出事:把问句池直接翻译成 KPI,会把前面所有的筛选工作作废。
能进 KPI 的:复现稳定性 4–5 分的问句,按核心池整体的加权提及率考核,不考核单条。
不能进 KPI 的:三次重跑品牌集合全不一致的高波动问句(我们样本中占 20.8%)、舍弃池里的问句、上线不足一个季度的新问句。
用月度而非周度做考核周期。周度波动里有相当比例来自平台侧的随机性,不是内容侧的效果。
外包给服务商时,验收条款要写清楚哪些是过程交付(问句池搭建、采集频次、报告口径),哪些是结果指标(核心池提及率),并明确排除不可控项,具体条款写法可参考 GEO 服务合同里 KPI 的边界划分。
GEO关键词研究常见的五个错误
对照检查,命中两条以上就该重做一轮:
- 只扩问句不看答案。问句列得再全,不去抓答案里的品牌和引用来源,就无法判断合并与舍弃,需求地图会退化成一张更长的关键词表。
- 只在一个平台测试。DeepSeek、豆包、Kimi、通义千问的信源偏好差异明显,单平台结论会误导内容投入方向。
- 把高波动问句写进 KPI。三次重跑结果全不一样的问句,用来做趋势观察可以,用来考核团队会制造假涨假跌。
- 用搜索量卡准入。AI 场景里大量高价值问句在关键词工具里查不到量,用搜索量做门槛会先砍掉最值钱的一批。
- 一次做完就不再更新。平台模型和信源结构在变,问句池至少每季度复核一次,重跑合并与舍弃判定。
七天启动清单
第一轮不需要完整工具链,一个人一周可以跑通最小闭环:
- 第 1–2 天:导出近 90 天站内搜索词与 Search Console 查询,筛出含限制条件与零结果的部分,定 20–30 个种子词。
- 第 3 天:抽 6 个月工单,按异议类型归类,改写成第一人称问句。
- 第 4 天:六种模板逐个种子词扩写,同时在四个平台跑种子问句收集追问链,得到初版问句表(预期 200–400 条)。
- 第 5–6 天:四平台各跑一轮,记录品牌集合与引用域名;按拆分 → 合并 → 舍弃的顺序执行三条规则。
- 第 7 天:四维打分,定出首批优化清单,排定内容排期。
第二周开始固定采集频次,两个完整周期后再做第一次判定复核。
常见问题
GEO关键词研究需要多少条问句才够?
不看绝对数量,看覆盖度。判断标准是:核心品类下的六类问法模板是否都有覆盖,主要竞品被稳定提及的问句是否都在池内。我们的实践经验是,单一品类 80–150 条核心问句已能覆盖多数决策场景,超过 300 条通常意味着该合并的没合并。
没有搜索量的问句值得做吗?
值得,但要有证据。搜索量缺失只说明关键词工具没收录,不代表没有需求。可用的替代证据包括客服工单频次、销售异议出现率、社区提问量、AI 平台追问建议中的出现次数。四类证据中命中两类以上即可纳入观察池。
问句多久重跑一次?
核心池建议每周三次、固定时段采集,用于趋势跟踪;合并与舍弃的判定规则每季度重跑一次。平台发生模型版本更新或搜索功能改版时,应立即做一次全量重测,因为信源权重变化会直接改写引用来源结构。
同一条问句在不同平台答案差很多,该以哪个为准?
不做加总平均,分平台看。四个平台的信源来源、内容偏好和更新频率都不同,把它们平均成一个数会掩盖真正的问题。正确做法是每个平台单独记录提及率和答案位次,再按各平台在目标人群中的实际使用份额分配优化优先级。
这套方法对 B2B 和 B2C 有区别吗?
框架一致,输入源权重不同。B2C 的高价值问句集中在选购决策与疑虑排除,客服工单是最好的输入源;B2B 的问句沿采购流程分布,销售异议记录和招投标文件里的技术条款更有价值,且单条问句背后的合同金额远高于 B2C,可干预性一项应当提高权重。
多语言或出海品牌怎么处理?
按语言分池,不做翻译复用。同一需求在中英文里的问法结构、限制条件表述和平台信源都不同,直译过去的问句在海外平台上常常查不到对应答案空间。正确做法是每个语种独立跑一遍四类输入源,种子词可以共享,问句层必须本地重建。
做这套研究需要多少预算?
人力上第一轮约 5–7 人天。工具成本主要看监控的品牌数、问句数和 AI 平台数三个变量,这三项通常是计价维度,构成差异很大,采购前先测算自己的核心池规模再对比报价,测算方法见 GEO 工具成本的构成与测算。
