AI搜索监测新对话的默认规则是:单轮推荐基准每次使用独立会话;模拟用户决策时,在同一路径内保留上下文,不同路径之间重新开会话。两类结果必须分开统计。
是否开新对话不是操作习惯,而是实验变量。先前出现的品牌、预算、竞品、负面评价和引用来源,都可能改变后续回答。若不隔离会话,团队很容易把上下文带来的变化误判为品牌提及率或推荐位置提升。

AI搜索监测什么时候必须开新对话?
只要测试目标是“没有历史提示时,AI会不会主动提及品牌”,每次运行都必须开新对话。若测试用户逐步筛选供应商的过程,则应保留路径内上下文。
| 测试任务 | 会话规则 | 实际测量的问题 |
|---|---|---|
| 无品牌词品类推荐 | 每次开新对话 | 品牌能否自然进入候选集 |
| 提示词改写对比 | 每个版本使用独立会话 | 哪种表达更容易触发品牌提及 |
| 竞品推荐份额 | 每次开新对话 | 各品牌在相同起点下的出现概率 |
| 引用来源基准 | 每次开新对话 | AI是否会独立找到并引用目标页面 |
| 优化前后复测 | 前后均使用独立会话 | 变化是否来自外部信息或模型更新 |
| 用户需求逐步细化 | 路径内保留上下文 | 品牌能否适应预算、地区和功能约束 |
| 异议与风险追问 | 路径内保留上下文 | 品牌受到质疑后能否留在候选名单 |
| 纠错能力测试 | 保留包含错误的原路径 | AI能否识别并修正前文信息 |
| 同一路径重复运行 | 每次重开会话 | 该决策路径是否可重复 |
一个简单判断方法是:
要测独立可见度,就清空上下文;要测决策过程,就保留有效上下文。
什么是上下文污染?
上下文污染是先前轮次、账号记忆或个性化设置改变当前回答,使样本偏离原定测量目标,而不是单纯指模型答错。
常见污染方式包括:
- 品牌预埋:前文讨论过品牌甲,后续无品牌词推荐仍优先出现品牌甲。
- 约束继承:上一轮设定预算有限,当前问题已取消预算条件,回答仍只推荐低价产品。
- 来源锚定:前文提供过某篇测评,后续回答持续复用其观点或引用。
- 情感惯性:先讨论品牌争议,再问是否值得采购,回答延续负面语气。
- 纠错记忆:用户修正过产品参数,后续回答变准确,但新用户未必会获得同样结果。
- 重试续接:自动化任务失败后在原会话中重试,模型实际接收了上一次请求或错误信息。
连续会话不是天然的脏数据。只有当历史上下文不属于研究变量,却仍然影响结果时,才构成污染。
为什么新建聊天窗口不等于干净会话?
“新对话”通常只清除当前线程记录,不一定清除账号记忆、个性化指令、地区、联网模式或监测工具附加的系统提示。
以 ChatGPT 为例,OpenAI 的记忆功能说明明确指出,已保存记忆和聊天历史可能影响后续对话。官方的临时聊天说明则说明,Temporary Chat 不会访问或创建记忆,但启用的自定义指令仍可能生效。
因此,干净会话至少要检查以下状态:
- 是否创建了新的会话或 thread ID;
- 是否登录账号;
- 记忆、聊天历史引用和个性化功能是否启用;
- 自定义指令或工作区系统提示是否生效;
- 模型名称、版本和推理模式是否一致;
- 联网、深度搜索或插件状态是否一致;
- 地区、语言和设备环境是否一致;
- 自动化重试是否复用了原会话。
无法关闭某项状态时,不应假装样本完全干净。正确做法是记录该状态,并把结果放入对应分层。
MaxAEO 的“双轨四层隔离”框架
MaxAEO 将会话监测拆成两条数据轨道、四层隔离条件。新建对话只处理线程层,不能替代完整的实验控制。
两条数据轨道
| 数据轨道 | 会话策略 | 核心指标 | 回答的问题 |
|---|---|---|---|
| 干净基线轨 | 每次运行使用独立会话 | 提及率、首位推荐率、前三率、引用率 | 品牌能否在无预埋条件下进入答案 |
| 决策旅程轨 | 路径内连续、路径间隔离 | 最终保留率、位置变化、情感转向率、证据延续率 | 品牌能否经受约束、比较和质疑 |
四层隔离条件
| 隔离层 | 必须控制的变量 | 常见失败方式 |
|---|---|---|
| 线程层 | 会话 ID、路径 ID、轮次、重试策略 | 新任务续接到旧对话 |
| 身份层 | 账号、记忆、个性化、自定义指令 | 新会话仍读取长期偏好 |
| 运行层 | 平台、模型、联网模式、地区、语言 | 把不同模型或搜索模式混合统计 |
| 采样层 | 时间窗口、执行顺序、重复次数、失败处理 | 优化前后在不同时间或不同顺序采集 |
这个框架解决了一个常见误区:页面上看见“新聊天”,不等于请求层、账号层和采样层已经隔离。
涉及账号、Prompt、原始回答和报告权限时,还应使用AI搜索监控平台数据安全评估清单检查数据保存、访问控制和删除机制。
哪些测试应保留连续会话?
当测试对象是用户如何逐步缩小选择、验证证据或提出异议时,上下文本身就是有效变量。删除上下文反而会破坏测试。
一条 B2B 采购路径可以这样设计:
| 轮次 | 提示词 | 观察指标 |
|---|---|---|
| 初选 | “推荐5个适合中国消费品牌的AI搜索监控平台。” | 是否提及、初始推荐位置 |
| 加约束 | “如果主要监测DeepSeek、豆包、Kimi和通义千问,如何缩小范围?” | 品牌是否保留、位置如何变化 |
| 查证据 | “这些平台如何证明数据可复现?请给出可核验依据。” | 事实准确性、来源质量 |
| 比竞品 | “请比较前三个平台的覆盖范围、证据留存和竞品分析能力。” | 比较中的优势与缺口 |
| 提异议 | “如果担心数据安全和服务商夸大效果,原推荐是否仍成立?” | 情感转向、品牌是否掉队 |
| 做决定 | “基于以上条件,最终应该让哪两家进入 POC?” | 最终推荐率、入围理由 |
同一路径应始终保留上下文,但每次重复完整路径前必须新建会话。这样得到的是多轮推荐韧性,而不是上一条测试路径残留的记忆。
如何设计干净会话与连续会话的对照实验?
可靠对照要保持平台、目标问题、时间窗口和重复次数一致,主要差异只能是目标问题之前是否存在预设上下文。
第一步:预先写明测量目标
每条任务在运行前填写一张“会话隔离卡”:
测量目标:独立可见度 / 决策旅程
分析单位:平台 × 提示词 × 地区 × 时间窗口
允许继承的上下文:
禁止继承的上下文:
固定环境:账号、模型、联网、语言、地区
失败重试规则:
有效样本规则:
若这些条件在看到结果后才决定,团队可能无意中保留有利样本、删除不利样本。
第二步:为提示词建立版本号
不要直接覆盖提示词。每次修改都保存完整原文、版本号和修改原因,例如:
P03-V1:推荐5个适合中国消费品牌的AI搜索监控平台。
P03-V2:推荐5个适合中国消费品牌的AI搜索监控平台,并说明平台覆盖与证据留存能力。
V1 和 V2 必须分别运行在独立会话中,否则第二个版本会受到第一个问题及其回答影响。
第三步:建立成对实验单元
以“平台 × 提示词 × 时间块”为一对:
- A 组:直接提交目标问题;
- B 组:先提交预设铺垫,再提交完全相同的目标问题;
- A、B 使用不同会话;
- 在不同时间块交替采用 A→B 和 B→A 顺序;
- 两组的模型、联网状态、账号和地区保持一致。
交替顺序可以降低平台短时更新、搜索结果变化和负载波动带来的偏差。
第四步:执行固定路径
干净组直接提问:
为一家中国消费品牌推荐5个AI搜索可见性监测平台。
请按平台覆盖、数据留痕、竞品分析和引用追踪能力说明依据。
连续组先执行两轮铺垫:
第一轮:我们正在评估品牌甲,请概括它的主要能力和适用客户。
第二轮:如果主要关注国产AI平台、竞品比较和引用来源,
品牌甲有哪些优势与限制?
第三轮:为一家中国消费品牌推荐5个AI搜索可见性监测平台。
请按平台覆盖、数据留痕、竞品分析和引用追踪能力说明依据。
第三轮才是两组共同的目标问题。前两轮是需要控制和记录的实验处理。
第五步:预先定义有效样本
以下情况可标记为无效:
- 平台故障或回答未生成;
- 请求被限流且未返回完整结果;
- 自动化程序提交了错误提示词;
- 应使用新会话却复用了旧会话;
- 模型或联网模式与实验计划不一致。
以下情况通常仍是有效结果:
- 没有提及目标品牌;
- 给出负面评价;
- 引用来源不足;
- 回答跑偏但请求实际提交成功。
无品牌提及和负面回答是研究结果,不能因为“不理想”而删除。无效样本应保留原始记录,并单独报告无效率。
第六步:失败重试使用新样本编号
若干净基线运行失败,重试时应创建新会话和新样本编号。不要覆盖原记录,也不要在失败线程中继续追问。
连续旅程若在中途失败,应按预设规则选择:
- 整条路径从新会话重新运行;或
- 将该路径标记为不完整,不计入最终保留率。
两种处理方式不能临时混用。
怎样计算上下文影响?
最直观的指标是会话敏感度,即连续会话提及率减去干净会话提及率。它表示品牌提及对历史上下文的依赖程度。
干净会话提及率
= 干净会话中提及品牌的有效回答数 ÷ 干净会话有效回答总数
连续会话提及率
= 连续会话中提及品牌的有效回答数 ÷ 连续会话有效回答总数
会话敏感度(百分点)
= 连续会话提及率 − 干净会话提及率
建议同时计算:
最终保留率
= 最后一轮仍推荐品牌的路径数 ÷ 第一轮曾推荐品牌的有效路径数
引用率
= 含至少一个可核验来源的有效回答数 ÷ 有效回答总数
情感转向率
= 品牌评价在路径中发生正负方向变化的路径数 ÷ 有效路径数
“可核验来源”应至少能定位到具体页面、文档或数据集。只写“据行业报告”“根据网络信息”不能计入引用率。
一个可复算的教学案例
以下是演示数据,不代表 MaxAEO 客户结果、平台表现或行业基准:
| 指标 | 干净会话,120条 | 连续会话,120条 | 错误的混合统计 |
|---|---|---|---|
| 品牌提及 | 22条,18.3% | 46条,38.3% | 68条,28.3% |
| 进入前三 | 9条,7.5% | 28条,23.3% | 37条,15.4% |
| 含可核验来源 | 11条,9.2% | 31条,25.8% | 42条,17.5% |
该案例的会话敏感度是:
38.3% − 18.3% = 20.0个百分点
如果报告只展示28.3%的混合提及率,管理层既看不到18.3%的独立可见度,也无法识别多轮铺垫带来的20个百分点差异。
因此,干净轨与旅程轨无论差异大小都应分开报告。差异阈值只能用于触发诊断,不能成为混合数据的理由。
同一提示词应该重复多少次?
没有适用于所有项目的固定次数。3至5次只能用于发现流程故障和明显波动,不足以证明提及率稳定。正式报告应根据允许误差、预期提及率和分析层级确定样本量。
若暂时把结果视为独立的二项样本,可用以下近似公式估算单个分析层级所需样本数:
n ≈ z² × p × (1 − p) ÷ E²
其中,95%置信水平对应 z = 1.96,p 是预期提及率,E 是允许误差。在最保守的 p = 0.5 条件下:
| 允许误差 | 估算样本量 |
|---|---|
| ±10个百分点 | 约96条 |
| ±5个百分点 | 约385条 |
比例区间的计算方法可参考NIST/SEMATECH 工程统计手册。
需要注意:同一提示词的多次回答可能相关,简单二项公式会低估不确定性。高风险决策应按平台、提示词和时间分层,并采用成对比较或以提示词为区组的重采样方法。
实践中可以把采样分成两阶段:
- 工程验证阶段:每个单元运行3至5次,检查会话隔离、字段导出和失败重试。
- 趋势测量阶段:根据允许误差扩展样本,并报告分母、时间窗口和置信区间。
如何判断是上下文污染还是合理延续?
判断标准不是回答有没有参考前文,而是前文影响是否属于当前测试目标。最可靠的方法是做一次干净会话反事实复测。
出现以下信号时,应触发复测:
- 当前问题没有品牌名,回答却反复强调前文品牌;
- 已取消预算、地区或功能限制,回答仍沿用旧条件;
- 回答使用“根据你刚才的偏好”等明显承接表述;
- 后续回答复用前文来源,却没有重新核验;
- 前文的正面或负面评价持续决定后续语气;
- 自动化日志显示多个独立样本共享会话 ID;
- 删除历史上下文后,品牌提及、位置或情感明显变化。
诊断步骤如下:
- 保存异常样本的完整对话和环境字段;
- 在相同平台与时间窗口新建独立会话;
- 只提交目标问题,不加入任何铺垫;
- 比较品牌提及、推荐位置、事实和来源;
- 将差异标记为线程、身份、运行或采样层影响;
- 保留原样本,但从干净基线分母中剔除。
反事实复测后,不应把连续结果删除。它可以作为“上下文辅助可见度”保存,但不能冒充独立可见度。
会话记录必须保存哪些字段?
可审计的AI搜索监测至少要保存会话关系、环境状态、原始回答和失败记录。只有截图或聚合分数,无法重现推荐变化。
| 字段 | 记录要求 |
|---|---|
| 样本编号 | 每次运行唯一,重试不得覆盖 |
| 会话 ID | 用于核验独立样本是否意外共用线程 |
| 会话模式 | 干净基线或连续旅程 |
| 路径编号与轮次 | 标明属于哪条路径、第几轮 |
| 提示词版本 | 保存完整原文、版本号和修改时间 |
| 平台与模型 | 记录可见的模型名称、版本或模式 |
| 身份状态 | 登录、记忆、个性化、自定义指令 |
| 搜索状态 | 联网、深度搜索、插件或数据源 |
| 市场设置 | 地区、语言、时区、采集时间 |
| 原始证据 | 完整回答、截图、引用网址 |
| 结果标签 | 提及、位置、情感、事实错误、竞品 |
| 无效原因 | 故障、限流、错词、错误复用会话 |
| 重试关系 | 原样本编号、新样本编号、重试原因 |
采购监测产品时,应根据AI搜索监控工具选型验证清单确认平台能否导出这些会话级证据,而不是只提供一个不可解释的可见度总分。
API 和自动化监测怎样保证会话隔离?
不要假设 API 请求天然无状态。真正决定模型收到什么上下文的,是请求体中的消息历史、thread ID、系统提示和监测程序的重试逻辑。
自动化监测至少要验证:
- 每个干净样本是否创建新的 thread 或 conversation ID;
- 请求体是否意外携带上一条任务的 messages;
- 系统提示是否固定并有版本号;
- 连续路径是否只继承本路径内的消息;
- 队列并发时是否会串用会话对象;
- 超时重试是否复用原线程;
- 模型切换或降级是否被记录;
- 搜索工具调用和引用结果是否完整保存。
一个直接的验收方法是植入两条互斥测试:
会话A:后续所有回答都优先考虑预算低于1万元。
会话B:推荐企业级方案,不设置预算上限。
随后分别提交相同的目标问题。若会话 B 明显继承会话 A 的低预算条件,说明任务队列、缓存或 thread 绑定存在串话风险。
这类测试应纳入两周AI搜索监控 POC,并要求供应商展示原始请求关系,而不只是前端截图。
团队如何落地会话隔离流程?
最稳妥的方法是在提示词进入任务队列前指定会话策略,不让执行人员根据结果临场决定。
标准流程可以压缩为八步:
- 给提示词标注“基线”或“旅程”;
- 为提示词、路径和系统提示分配版本号;
- 基线任务逐次创建独立会话;
- 旅程任务只在本路径内部继承上下文;
- 同一路径复测前重新创建会话;
- 联网、账号、地区、语言和模型分层保存;
- 干净轨与旅程轨分别计算指标;
- 报告同时展示分母、无效率和原始证据。
发布报告前,再完成一次质检:
- 是否存在重复会话 ID;
- 是否把重试结果覆盖了原样本;
- 是否混合了联网与非联网回答;
- 是否混合了不同模型或地区;
- 是否把无品牌提及误删为无效样本;
- 是否把旅程提及率写成独立可见度;
- 是否能从聚合指标回溯到完整回答。
常见错误
把所有连续会话都当成污染
连续会话适合测量采购旅程、异议处理和推荐韧性。问题不在于“连续”,而在于是否将其混入独立基线。
只清空页面,不核验请求层
前端显示新聊天,不代表自动化程序没有复用 thread ID、消息数组或缓存对象。应以会话日志和请求关系为准。
优化前后只各运行一次
生成式回答本身存在波动。单次前后对比无法区分内容变化、时间变化和随机波动。
只报告百分比,不报告分母
“提及率提升20%”可能表示从5%升到6%,也可能表示从20%升到40%。报告必须注明原始计数、有效样本数和百分点差值。
为了提高提及率而预埋品牌
在提示词中加入品牌名称可以测认知、评价或事实准确性,但不能证明品牌会在无提示条件下被主动推荐。
常见问题
每条提示词都必须开新对话吗?
不需要。单轮品类推荐、提示词改写、竞品份额和优化前后复测必须使用独立会话;模拟用户连续决策时,应在路径内保留上下文,但每次重复整条路径前重新开会话。
新建会话就一定没有上下文污染吗?
不一定。新会话可能仍受账号记忆、个性化、自定义指令、联网模式或监测程序系统提示影响。无法关闭这些功能时,应记录状态并单独分层。
使用无痕窗口或临时聊天就足够了吗?
不一定。无痕窗口主要隔离浏览器本地状态;登录后的服务端设置仍可能生效。临时聊天能否隔离记忆,也要以具体平台的官方说明为准,并检查自定义指令和系统提示。
同一提示词至少重复多少次?
3至5次适合验证流程和发现明显异常,不适合证明提及率稳定。正式监测应根据允许误差、预期提及率和分析层级确定样本量,并报告分母及置信区间。
误用旧会话的结果还能保留吗?
可以保留为异常样本,用于分析上下文敏感度,但必须从干净基线分母中剔除。补跑时应创建新会话和新样本编号,同时保留原记录。
连续会话应该观察哪些指标?
重点观察最终保留率、推荐位置变化、情感转向、事实一致性、来源延续和最终入围率。不要把连续会话提及率直接解释为品牌的独立AI可见度。
干净会话与连续会话可以合并成一个总分吗?
不建议。两者测量的问题不同,合并后无法判断品牌是自然进入候选集,还是依赖前文铺垫才被推荐。管理层总览可以并列展示,但底层分母和指标必须分开。