GEO招标需求书是品牌采购生成式引擎优化与AI搜索监测服务时,用于统一范围、报价、数据、交付和验收口径的正式文件。
它不能只写“提升AI可见度”。一份能执行、能复算的需求书,至少要包含:监测范围、问题集、数据字段、服务动作、交付物、报价单位、验收公式、数据安全和变更机制。

MaxAEO建议采用“六张表、四层证据、双层验收”框架:
- 六张表:范围配置表、问题集、数据字典、交付验收表、报价清单、变更记录;
- 四层证据:请求、原始数据、指标计算、验收结论;
- 双层验收:硬性验收可控交付,观察性评估模型结果。
一份完整的GEO招标需求书应写什么?
完整的GEO招标需求书应回答以下十个问题。缺少其中任何一项,都可能造成供应商报价不可比或项目结果无法复核。
- 采购目标是监测、诊断、内容优化,还是持续运营?
- 覆盖哪些品牌、竞品、市场、语言和AI平台?
- 使用哪些问题,如何区分自然发现与品牌诊断?
- 每个问题采集几次,基线期和复测期如何确定?
- 什么算有效回答、品牌提及、推荐和引用?
- 供应商需要保存哪些原始证据?
- 内容、技术、报告和培训分别交付什么?
- 哪些指标硬性验收,哪些只观察趋势?
- 平台升级、拒答或入口变化时如何处理?
- 数据、账号、知识产权和分包责任如何约定?
普通营销招标模板通常已有背景、预算、团队和工期,却容易遗漏模型随机性、联网状态、重复采样、引用来源、无效样本及统计分母。这些恰恰是GEO项目最容易产生争议的部分。
招标前先确定采购类型
**先确定采购的是工具、项目服务还是持续运营,再编写需求书。**三种采购方式的成本结构、交付责任和验收方法不同,不应放在同一张总价表里比较。
| 采购类型 | 适用情况 | 主要交付 | 常见计价方式 |
|---|---|---|---|
| 监测工具 | 企业已有分析和执行团队 | 数据采集、仪表盘、导出、预警 | 品牌数、监控词数、平台数、席位、历史数据 |
| GEO诊断项目 | 需要建立基线和行动方案 | 基线数据、差距诊断、任务清单、复测 | 固定项目费加范围变更费 |
| 内容与技术实施 | 内部缺少执行资源 | 页面修改、内容生产、结构化数据、技术整改 | 按页面、工时或里程碑 |
| 持续运营 | 需要长期监测和迭代 | 月度采集、异常分析、内容迭代、季度复盘 | 月费或年度服务费 |
| 混合采购 | 工具与咨询由同一供应商提供 | 软件、数据、诊断和实施 | 软件费与服务费分项报价 |
工具成本通常受品牌数、问题量、平台数、采集频次和历史数据影响,可先查看GEO工具的主要计价变量,避免只比较一个无法解释的年度总价。
项目范围应该写到什么粒度?
**凡是会改变采集量、服务工时或责任边界的变量,都应进入范围配置表。**不要把“覆盖主流平台”“监测核心问题”等表述留到项目启动后再解释。
| 范围维度 | 可直接采用的写法 |
|---|---|
| 主品牌 | 1个主品牌,列明正式名称、简称、英文名和常见误写 |
| 竞品 | 5个固定竞品;新增或替换竞品须书面变更 |
| AI平台 | DeepSeek、豆包、Kimi、通义千问;逐一注明网页端、应用端或API |
| 模型与模式 | 记录界面可见的模型名称、联网状态及深度思考模式;不可见时标记“平台未披露” |
| 地区与语言 | 中国大陆、简体中文;其他地区和语言单独报价 |
| 问题集 | 60个固定问题,划分意图、优先级和业务阶段 |
| 采样次数 | 每个平台、每个问题、每个观察期重复3次 |
| 观察周期 | 基线期、实施期、冷却期、复测期分别写明日期 |
| 服务动作 | 监测、诊断、内容建议、内容实施、技术整改、复测和培训分列 |
| 排除项 | 媒体采买、百科编辑、网站开发、危机公关及第三方发布单列 |
| 变更机制 | 新增平台、问题、竞品、语言或采集频次时按约定单价计算 |
如果供应商通过API采集,还要说明API结果是否与用户实际使用的网页端一致。两种入口的模型、联网能力、引用展示和参数可能不同,API数据不得默认代表真实用户界面结果。
问题集怎样设计才不会虚高结果?
**问题集应拆成“自然发现池”和“品牌诊断池”,两者分别统计。**如果问题中已经出现品牌名,再把回答中的品牌提及计入总体提及率,会系统性高估可见度。
自然发现池
问题中不出现品牌名,用于观察用户尚未锁定供应商时,品牌能否自然进入回答。
- “适合连锁门店的会员管理系统有哪些?”
- “预算十万元以内,采购此类软件应考察什么?”
- “哪些供应商支持私有化部署和多门店权限管理?”
- “甲类方案与乙类方案在实施成本上有什么区别?”
品牌诊断池
问题中明确出现品牌名,用于检查品牌事实、评价、风险信息和引用来源是否准确。
- “某品牌支持哪些部署方式?”
- “某品牌与竞品相比适合什么规模的企业?”
- “某品牌是否发生过安全或服务争议?”
- “某品牌的价格、服务范围和交付周期是什么?”
建议的意图分层
| 意图层 | 用户任务 | 建议占比示例 |
|---|---|---|
| 认知 | 了解品类、方案和术语 | 15% |
| 比较 | 比较功能、价格、适用场景 | 25% |
| 推荐 | 寻找候选品牌或产品 | 25% |
| 采购 | 评估预算、部署、服务和风险 | 25% |
| 尽调 | 核查资质、争议、安全和事实 | 10% |
占比应根据业务调整,不是统一行业标准。采购方负责提供客户原话、销售问答和重点场景;供应商负责去重、分层和可监测性检查;最终问题集由采购方确认并冻结。
数据规格怎样写才能独立复核?
**每个汇总指标都必须能追溯到逐条原始回答。**只交付趋势图、百分比或演示文稿,无法判断供应商是否漏采、删样本或改变过标签口径。
每条采集记录至少应包含:
- 问题编号、完整问题、问题池、意图、优先级和业务阶段;
- 平台、入口、账户状态、地区、联网模式和可见模型版本;
- 计划采集时间、实际采集时间、轮次和响应状态;
- 原始回答全文,不得只保留供应商整理后的摘要;
- 主品牌与竞品的提及状态、首次出现位置和推荐语境;
- 正面、中性、负面及无法判断的情感标签;
- 引用网址、域名、页面标题和引用在回答中的对应位置;
- 截图、原始响应文件或其他证据编号;
- 自动标签、人工复核结果、复核人和修改记录;
- 无效样本原因、补采状态和数据校验值。
什么算有效回答?
建议在需求书中直接冻结以下规则:
- **有效回答:**平台正常返回与问题相关且可供判断的完整内容;
- **无效回答:**技术报错、空白响应、与问题无关、平台拒答或回答被截断;
- **相似回答:**只要是按计划独立采集的轮次,不因内容相似而删除;
- **补采回答:**必须保留原无效记录,并给补采记录新的编号;
- **平台下线:**单独报告,不得把受影响平台从分母中静默移除。
同一问题的多次回答并非完全独立样本。正式分析应按“问题×平台”配对比较基线与复测,并披露模型升级、内容上线、媒体事件和竞品活动等干扰因素。更多误差来源可参考AI搜索监控数据的抽样与校准方法。
交付物应该包含哪些文件?
交付物必须覆盖原始证据、分析结论、执行任务和复测结果,而不只是月报或仪表盘。
| 交付物 | 最低内容 | 验收方式 |
|---|---|---|
| 范围配置表 | 品牌、竞品、平台、入口、地区、问题量、频次 | 与冻结版本逐项核对 |
| 固定问题集 | 问题文本、问题池、意图、优先级、适用平台 | 检查重复、诱导问题和品牌问题混入情况 |
| 基线数据包 | 全量回答、引用、标签、异常和证据编号 | 复算指标并抽查原始记录 |
| 数据字典 | 字段定义、枚举值、缺失值和公式 | 用样例记录验证 |
| 基线诊断 | 平台差距、竞品差距、事实错误和引用缺口 | 每条结论对应数据 |
| 优化任务表 | 对象、依据、动作、负责人、优先级、风险和状态 | 逐项检查可执行性 |
| 内容与技术成果 | 页面修改稿、事实来源、上线记录、技术变更 | 与任务及上线页面核对 |
| 阶段报告 | 指标变化、异常、已完成事项和下一步 | 与原始数据一致 |
| 复测报告 | 同口径前后对比、未改善项和影响因素 | 复算并检查口径变化 |
| 项目移交包 | 配置、数据、字段字典、权限和培训材料 | 按移交清单签收 |
优化建议不能只写“增加权威内容”“加强品牌曝光”。一条可验收建议至少要说明:
- 修改哪个页面或资产;
- 对应哪个问题和数据证据;
- 需要新增、删除或改写什么;
- 由谁执行、何时完成;
- 有哪些法律、品牌或事实风险;
- 完成后如何检查。
采购方可用AI内容优化建议验收判别表区分可执行建议、无效建议和高风险建议。
内容交付还应符合Google关于创建实用、可靠、以用户为先的内容指南。机械堆叠品牌词、批量生成近似页面或虚构专家观点,不应计入有效交付量。
验收指标和公式怎么约定?
**验收分为两层:确定性交付用于付款验收,模型结果用于趋势评估或附带激励。**供应商能控制数据是否完整、任务是否完成,却不能完全控制第三方模型的最终推荐。
第一层:确定性硬验收
可用于里程碑付款的项目包括:
- 计划样本是否按约定完成;
- 必填字段和原始证据是否完整;
- 汇总指标能否从原始记录复算;
- 标签与证据是否一致;
- 诊断和优化任务是否满足字段要求;
- 约定内容、技术整改和培训是否完成;
- 数据、配置和账号权限是否完成移交。
第二层:观察性结果指标
| 指标 | 计算公式 | 口径要求 |
|---|---|---|
| 品牌提及率 | 提及品牌的有效回答数 ÷ 有效回答总数 | 自然发现池与品牌诊断池分开 |
| 首位推荐率 | 品牌最先进入推荐名单的回答数 ÷ 有效回答数 | 普通举例不算推荐 |
| 重点解释率 | 对品牌提供实质说明的回答数 ÷ 有效回答数 | 冻结“实质说明”的判定规则 |
| 引用覆盖率 | 含可识别引用来源的回答数 ÷ 有效回答数 | 无网址的笼统来源单列 |
| 品牌事实准确率 | 品牌事实无错误的有效回答数 ÷ 含品牌事实的回答数 | 依据冻结的事实清单人工复核 |
| 负面提及率 | 负面品牌提及回答数 ÷ 品牌提及回答数 | 争议样本必须人工复核 |
| 竞品声量占比 | 主品牌提及次数 ÷ 指定品牌总提及次数 | 说明一条回答是否可多品牌计数 |
推荐位置不能用一个模糊的“平均排名”概括。AI回答中的首次出现、进入候选名单和被重点解释是不同信号,应按AI推荐位置的统计口径分别计算。
变化应使用“百分点”表达。例如,提及率从30%升至36%,是增加6个百分点,相对增长率才是20%。两种说法不得混用。
验收阈值示例
以下阈值用于展示条款写法,不是行业统一标准:
| 硬验收项目 | 示例阈值 | 未通过时的处理 |
|---|---|---|
| 有效样本覆盖率 | 不低于95% | 在约定期限内补采 |
| 必填字段完整率 | 不低于99% | 补齐字段并重新导出 |
| 抽查证据一致率 | 不低于98% | 更正同类记录并说明原因 |
| 指标复算误差 | 不超过0.5个百分点 | 修订公式、数据或报告 |
| 优化任务字段完整率 | 100% | 缺少依据或责任人的任务不计数 |
| 数据移交完成率 | 100% | 完成移交后再支付尾款 |
用720次回答演算一次验收
假设项目覆盖4个平台、60个自然发现问题,每题在基线期和复测期各运行3次,则每个观察期计划获得:
4个平台 × 60个问题 × 3次 = 720次回答。
假设基线期有278次回答提及品牌:
基线提及率 = 278 ÷ 720 = 38.6%。
复测期有356次回答提及品牌:
复测提及率 = 356 ÷ 720 = 49.4%。
因此提及率增加:
49.4% − 38.6% = 10.8个百分点。
如果采购方从复测数据中随机抽查72条,其中71条的字段与原始证据一致:
抽查一致率 = 71 ÷ 72 = 98.6%。
这组数据只演示计算方法,不代表MaxAEO客户结果或行业基准。正式报告还应分别展示各平台、各意图和各问题的变化,避免一个平台的增长掩盖另一个平台的下降。
报价清单应该怎样拆分?
**要求供应商同时填写数量、单价、计价周期和超量价格,才能形成可比报价。**只有一个年度总价,无法判断低价是否通过减少采样、证据或服务工时实现。
| 报价项 | 建议计价单位 | 必须说明 |
|---|---|---|
| 主品牌监测 | 品牌/月或品牌/项目 | 别名是否占用品牌额度 |
| 竞品监测 | 竞品/月 | 新增和替换价格 |
| AI平台 | 平台/月 | 网页端、应用端或API |
| 问题采集 | 问题数或运行次数 | 重复次数和失败补采是否收费 |
| 历史数据 | 月或年 | 可回溯范围和数据来源 |
| 数据导出/API | 调用量或固定费用 | 字段、频率和速率限制 |
| 基线诊断 | 项目 | 包含的访谈、报告和汇报次数 |
| 优化建议 | 页面、任务或工时 | 修改轮次和验收标准 |
| 内容实施 | 页面或字数区间 | 研究、编辑、设计和上线是否包含 |
| 技术实施 | 工时或里程碑 | 测试、回滚和部署责任 |
| 培训 | 场次 | 人数、时长、录屏和材料 |
| 定制开发 | 人日 | 需求确认和变更单价 |
招标文件还应要求供应商分别列出一次性费用、订阅费用、可选费用和第三方费用,并说明税费、付款节点及合同终止后的数据导出成本。
如何评分和选择GEO供应商?
供应商评估应以现场复算和样本抽查为核心,不应只看案例截图或演示仪表盘。
下面是一套总分100分的评分示例:
| 评分项 | 分值 | 重点证据 |
|---|---|---|
| 数据与证据能力 | 25 | 原始回答、字段字典、异常记录、可复算公式 |
| 方法与问题集设计 | 15 | 分层方法、去诱导规则、重复采样和版本记录 |
| 交付与项目管理 | 20 | 交付模板、责任人、里程碑、变更流程 |
| 内容与技术实施 | 15 | 真实样稿、上线记录、质量控制和风险审查 |
| 数据安全与合规 | 10 | 权限、保存、删除、分包及事故响应 |
| 服务团队 | 10 | 实际执行人员、相关经验和投入时间 |
| 商务报价 | 5 | 单价透明度、范围边界和超量费用 |
评审现场可以要求每家供应商完成三个动作:
- 从汇总提及率随机抽取10条记录,追溯到原始回答;
- 使用其数据字典重新计算一个指标;
- 展示一条优化建议如何从问题、证据进入任务和验收。
以下承诺需要重点追问:
| 供应商说法 | 采购方应追问 |
|---|---|
| “覆盖所有主流模型” | 具体平台、入口、模式和更新频率是什么? |
| “保证行业第一” | 如何控制模型升级、随机性和第三方内容变化? |
| “拥有独家算法” | 能否提供标签规则、错误样本和人工复核记录? |
| “实时监测” | 实时是分钟、小时还是每日批量更新? |
| “自动生成建议” | 每条建议是否对应页面、证据、负责人和风险? |
| “效果显著” | 基线、分母、观察期和异常处理规则是什么? |
数据安全、知识产权和禁止事项怎么写?
**需求书应明确数据用途、访问权限、保存期限、知识产权、分包和退出责任。**Prompt、账号、客户问题、未发布产品资料和销售数据都可能包含商业秘密或个人信息。
至少应加入以下条款:
- 供应商只可将数据用于本项目,不得用于模型训练或其他客户项目;
- 未经书面批准,不得把采购方名称、结果或截图用于公开案例;
- 披露实际使用的模型API、云服务商和分包方;
- 采用最小权限原则,规定账号、双重验证和人员离场后的权限回收;
- 明确数据存储地区、加密方式、访问日志、保存期限和删除证明;
- 规定数据泄露、账号异常和误发布的通知时限与处置责任;
- 明确问题集、数据、定制规则、内容草稿和最终成果的权属;
- 合同终止后导出全部数据、配置、字段字典和变更记录;
- 涉及个人信息、客户数据或跨境传输时,由法务根据适用法律另行审查。
需求书还应禁止以下做法:
- 虚构客户评价、专家身份、资质、案例或统计数据;
- 未经授权编辑百科、论坛或第三方资料;
- 批量发布低质量近似页面;
- 用隐藏文本、虚假引用或误导性结构操纵结果;
- 未经审核自动发布涉及价格、法律、安全或竞品评价的内容。
平台变化和项目延期如何处理?
模型升级、入口变化和大规模拒答应触发变更流程,而不是由供应商单方面修改分母。
建议设置以下规则:
- 发现平台、模型或联网状态变化后一个工作日内登记;
- 评估变化是否影响基线与复测的可比性;
- 影响较小时保留原计划,并在报告中单列;
- 影响较大时暂停受影响平台,双方书面确定补采或重建基线;
- 原始无效记录必须保留,不能只保留补采后的成功结果;
- 所有问题、公式、标签和平台调整都写入变更记录;
- 复测应在约定内容上线且可公开访问后开始,并记录上线日期。
GEO结果可能受搜索引擎抓取、页面更新和AI平台刷新周期影响。需求书应约定复测窗口,但不应虚构统一的“收录后几天必然生效”期限。
可直接复制的GEO招标验收条款
以下文本可按项目规模、预算和法务要求删改:
**项目范围:**供应商应在双方确认的AI平台、入口、地区和账户条件下,对冻结的问题集执行基线采集、诊断、优化和复测。未经书面变更,不得替换问题、平台、统计分母或标签规则。
**问题集管理:**自然发现问题与包含品牌名称的诊断问题应分别建池、分别统计。问题集须包含编号、完整文本、意图、优先级、适用平台和版本记录。
**数据交付:**每条记录须包含问题编号、平台、入口、采集时间、轮次、原始回答、品牌及竞品标签、推荐位置、情感、引用来源、响应状态和证据编号。供应商不得静默删除无效记录。
**证据复核:**采购方可随机抽查不少于有效记录的10%。被抽查记录须追溯至原始回答、截图或响应文件;字段与证据不一致时,供应商应在五个工作日内更正同类记录并说明原因。
**指标计算:**品牌提及率、首位推荐率、重点解释率、引用覆盖率、事实准确率及负面提及率,须按本需求书冻结的定义和分母计算。自然发现池与品牌诊断池不得合并计算总体提及率。
**优化交付:**每项建议必须注明目标页面或资产、对应问题、数据依据、具体动作、实施优先级、风险、责任方和完成状态。无法定位执行对象或缺少数据依据的通用建议,不计入完成量。
**效果观察:**双方在相同问题集、平台、入口和重复次数下比较基线期与复测期。模型结果用于趋势评估或约定的激励机制,不构成对特定模型输出、自然排名或销售收入的绝对保证。
**异常与变更:**因平台故障、模型升级、入口调整或大规模拒答产生的无效记录应单列。有效样本不足时优先补采;无法补采时,双方通过书面变更调整受影响范围。
**数据安全:**供应商不得将采购方数据用于本项目以外的模型训练、宣传或第三方服务。新增分包方、模型API或数据存储地点须事先披露并取得约定批准。
**项目退出:**项目结束或终止后,供应商应在约定期限内移交全部原始数据、字段字典、配置、证据和培训材料,并删除无继续保存依据的采购方数据。
发标前检查清单
发布GEO招标需求书前,采购、市场、技术和法务应共同确认:
- 已明确采购类型和业务目标;
- 已冻结主品牌、别名、竞品、平台和入口;
- 自然发现池与品牌诊断池已分开;
- 已定义有效回答、无效回答和补采规则;
- 已确定重复次数、基线期和复测期;
- 每个指标都有公式、分母和标签规则;
- 原始回答、引用和证据可以导出;
- 交付物写明格式、频次、责任人和验收方式;
- 软件、服务、内容和第三方费用已分项;
- 已设置平台变化和需求变更流程;
- 已约定数据用途、权限、分包、保存和删除;
- 已区分硬性验收与观察性结果;
- 供应商评审包含现场复算和证据抽查;
- 尾款支付与数据移交、整改完成挂钩。
常见问题
GEO招标时应该规定提及率提升多少吗?
可以设置目标区间,但不宜把提及率提升作为唯一硬性验收条件。模型升级、新闻事件、竞品活动和第三方内容都会影响结果。更稳妥的方式是硬性验收数据、证据和实施任务,对提及率等结果设置观察目标或阶梯激励。
问题集应该由采购方还是供应商提供?
双方共同完成。采购方提供客户原话、业务场景、重点产品和采购问题;供应商负责意图分层、去重、去诱导和可监测性检查。最终问题集应由采购方确认、编号并冻结。
只提交仪表盘账号能否完成验收?
不能。仪表盘只是展示层。采购方还需要可导出的原始回答、字段字典、引用来源、证据文件和计算规则,否则无法独立复算指标,也难以在更换供应商后延续监测。
GEO服务与AI舆情监测可以合并采购吗?
可以共用部分平台和数据基础设施,但应拆分工作范围。GEO关注推荐、引用、竞品比较和事实准确性;舆情监测关注负面事件、传播速度、风险等级和响应时效。两者的样本、频次及处置流程不同,具体差异可参考AI搜索监控与舆情监测的对比。
小规模项目需要先做POC吗?
当平台、问题量或数据质量尚未验证时,可以先做小范围POC。POC仍应使用正式数据字段和验收公式,重点验证采集稳定性、证据可追溯性、问题集质量和建议可执行性,而不是急于证明提及率增长。
项目周期结束后应保留哪些材料?
至少保留冻结后的范围配置、问题集、基线与复测数据、原始证据、字段字典、标签规则、变更记录、优化任务和验收结论。合同还应明确保存期限、访问权限、删除证明及供应商退出后的数据格式。
一份合格的GEO招标需求书,应让不同供应商能够对同一范围报价,让采购方能够从任何汇总数字追溯到原始回答,并让市场、采购、技术和法务清楚区分:供应商必须完成什么,模型结果可能如何变化。