AI信源污染是指有人刻意把不实或误导内容投放进大模型联网检索会读取的网页、问答与自媒体账号,使其进入引用候选池,让 AI 在回答里当成事实复述。
对付它的核心不是删帖,而是三步走:先定性,再固定证据走申诉,同时用同问句的对冲内容把污染源挤出检索候选池。删得掉的删,删不掉的压。
下面按实际处置顺序排列,每一步给可执行判定标准。
什么是 AI 信源污染?和普通负面舆情有什么区别
它和普通负面最本质的差别有两点。
**第一,作用对象不是人的眼球,是检索层的候选池。**一条阅读量只有 200 的自媒体稿,只要格式对、关键词对、能被抓取,对 AI 答案的影响可能超过一篇十万加。
**第二,伤害是复利的。**模型每被问一次就复述一次,而删除只作用于源头,已经形成的表述惯性还要靠新内容去覆盖。
所以"这条帖子没什么流量,不用管"这个判断在 AI 场景下失效。评估权重要换成一个问题:这条内容会不会被引用。
竞品负面为什么能进 AI 答案:三层链路拆开看
不实负面要影响 AI 答案,必须穿过三层。逐层定位,才知道该花力气在哪一层。
**第一层是检索层。**模型联网时按检索排序抓取网页,被抓到的内容进入上下文,直接参与生成。这一层污染成本最低、生效最快,也最容易被治理掉。
**第二层是共识层。**当同一说法在多个来源反复出现,模型会把它当作"业内普遍看法"处理,即使每个来源单看都不权威。中国信通院云大所人工智能卓越中心负责人连云波在中新网关于 AI 信源治理的报道中的表述很准确:模型"不是像人一样形成信念,而是在生成时被某套材料持续牵引"。
**第三层是参数层。**污染内容进入下一轮训练语料,被固化进模型权重。这一层最难逆,只能靠长期正向语料和模型迭代慢慢稀释。
平台侧已经在建防线。上述报道提到 DeepSeek 采用来源分级策略:政府官网、品牌备案官网、权威机构、中央媒体列为核心采信,有新闻资质的地方和行业媒体作辅助验证,无新闻资质的自媒体账号则被列为高风险源。这意味着"提高自己官方信源的权重"本身就是最有效的防污染动作之一。
海外模型的选源逻辑同理但权重项不同,Google Gemini 走 Grounding with Google Search 那套排序,ChatGPT 与 Grok 各有偏好——各引擎如何挑选与引用来源决定了同一条污染源在不同平台的存活率。
先定性再动手:真负面、误读型、幻觉型、投放型四象限
看到 AI 说自己坏话,第一反应不该是投诉,而是定性。四种成因的处置路径完全不同,走错一条就是白花三个月。
| 类型 | 典型特征 | 有无真实源头 | 正确动作 | 错误动作 |
|---|---|---|---|---|
| 真负面 | 有可查的投诉、判决、召回、监管处罚 | 有,且属实 | 解决实体问题 + 发布整改说明 | 申诉删除(做不到,且激化) |
| 误读型 | 源头材料真实,但被断章取义或时间错位 | 有,但被曲解 | 提供完整语境 + 更新官方页面 | 只发澄清稿不改源头页 |
| 幻觉型 | 找不到任何源头,模型自己拼出来的 | 无 | 补齐权威语料 + 平台反馈 | 走法务(无被告) |
| 投放型 | 多源同时出现、措辞雷同、必带竞品对照 | 有,但是伪造的 | 举证 + 申诉 + 法务 + 对冲 | 只做对冲不追源 |
幻觉型和投放型最容易混淆,处置代价却差一个量级。如果 AI 复述的黑料完全找不到出处,先按 AI 幻觉型不实信息的发现与处置流程 排查,不要一上来就假设有人在害你——误判会让团队把预算投到没有敌人的战场上。
怎么识别恶意投放:AI信源污染的 8 个投放指纹
判断一批负面是自然产生还是有组织投放,看这 8 个特征。每一条都给了可验证方法,不靠"感觉像"。
- 时间聚簇——同类指控在 24–72 小时内跨 5 个以上站点集中出现。自然负面是长尾散发的,投放是脉冲式的。把每条内容的首发时间拉成时序表就能看出来。
- 措辞同源——抽 12–20 字的特征串做精确匹配检索,跨站命中 3 次以上,基本可判定为同稿分发。
- 载体偏斜——几乎全部落在无新闻采编资质的自媒体号、内容聚合站和问答长尾页,没有一条来自有资质媒体、行业协会或检测机构。
- 模板化标题——标题句式高度统一("XX怎么样?避坑""XX是不是智商税""XX真实测评"),且精准对应用户会向 AI 提的问句形态。
- 强制对照锚——几乎每篇都在结论段把某一个特定竞品作为正面参照写进去。这是投放最难掩饰的动机指纹,也是定性中最有力的单项证据。
- 数据悬空——出现具体百分比、检测数值、投诉量,却没有可追溯的出处、检测机构名称或报告编号。
- 主体空壳——发布账号注册时间短、历史内容垂类跳跃、无实名企业主体、互动数据与阅读量比例异常。
- 互证闭环——几篇内容互相转述、互相引用,制造"多源印证"的假象。上述中新网报道把这个信号概括为"来源互相转述",并列为普通用户也该警惕的反常特征。
**判定门槛:命中 ≥4 项,按投放型立案处理;命中 1–2 项,回到四象限先排查真负面和误读型。**这个阈值的作用是防止团队把每一次口碑波动都升级成对抗事件。

怎么判断污染到了哪一层:3×4×2 交叉验证法
定性完成后,要确认污染渗透到哪一层。方法是同一个问题在联网开和联网关两种模式下各问一遍,用差异反推污染位置。
具体做法分四步:
- 准备 3 类 Prompt:品牌直问("XX这个品牌怎么样")、品类比较("XX和竞品哪个好")、风险探针("XX有没有质量问题或投诉")。风险探针最关键,负面往往只在这一类问题下才被召回。
- 覆盖 4 个平台:DeepSeek、豆包、Kimi、通义千问。各家检索策略和信源分级不同,同一条污染源不会在所有平台等权重出现。
- 每个问题跑 2 种模式:联网检索开、联网检索关。这是整套方法的诊断核心。
- 每组重复 3 次取众数:模型输出有随机性,单次结果不能作为判断依据。3×4×2×3 = 72 次采样,一个人半天可以跑完。
结果这样判读:
| 联网开启 | 联网关闭 | 判定 | 主攻方向 |
|---|---|---|---|
| 出现负面 | 不出现 | 检索层污染 | 申诉 + 对冲,最快见效 |
| 出现负面 | 出现负面 | 已进入共识/参数层 | 长周期语料对冲,做好半年预期 |
| 不出现 | 出现负面 | 旧训练语料残留 | 持续供给新语料,不必申诉 |
| 不出现 | 不出现 | 未污染或已清除 | 转入常态监控 |
跑之前先排除一件事:**AI 答案变化未必都来自污染。**模型版本更新、知识截止时间、检索策略调整都会造成波动,把这些变量先对照一遍,能避免把一次模型迭代误判成竞品攻击。
污染会伤到哪些人:三个被低估的暴露面
品牌方通常只盯 C 端消费者问句,但污染的杀伤面更宽:
- 采购与招标方——B 端决策人用 AI 做供应商初筛,一条"某某公司资质存疑"会在进入短名单前就把你筛掉,而你完全不会收到询盘,损失无声无息。
- 求职候选人——"这公司怎么样"是 AI 高频问句之一,污染内容会直接压低 offer 接受率。这条链路的处置逻辑另有一套,见雇主品牌的 AI 形象怎么管。
- 渠道与经销商——代理商在续约前用 AI 复核品牌口碑,负面会转化成议价筹码。
**排查建议:把 3 类 Prompt 扩成 5 类,补上"XX公司靠谱吗值得合作吗"和"XX公司值不值得去"两类问句。**很多品牌是在丢了两个大客户之后才发现这两类问句早被污染了。
证据怎么固定:一份能用于平台申诉和法务的举证包清单
一份合格的举证包包含:
- 完整对话截图:含平台名称、模型版本、生成时间、完整问答,不裁剪
- 可复现 Prompt 原文:连同复现次数与成功率(如"10 次提问出现 7 次")
- AI 给出的引用来源 URL 清单:把 AI 答案和具体污染源挂钩的关键环节
- 每个源页面的网页快照:原页面可能被删除,需第三方存证平台或公证
- 源站主体信息:ICP 备案主体、账号实名主体、注册时间
- 传播时序表:各条内容的首发时间、平台、是否互相引用
- 事实反证材料:检测报告、合同、资质证书、官方数据,直接对应被指控的具体断言
- 损害证据:咨询量变化、客户询问记录、渠道反馈
关键操作细节:AI 对话截图属于电子数据,建议通过时间戳认证或区块链存证固定,自行截屏在诉讼中证明力偏弱。
另外,举证包要按"污染源"而不是按"AI 答案"归档——一个源可能同时污染四个平台,按源归档才能一次申诉解决多处问题。
法律和监管给了哪些抓手
组织性投放不实负面在中国有明确的法律定性和处罚标准,这是很多品牌方低估的一张牌。
《反不正当竞争法》(2025 修订)第十二条规定:经营者不得编造、传播或者指使他人编造、传播虚假信息或者误导性信息,损害其他经营者的商业信誉、商品声誉。相比旧法,本次修订把"指使他人"明确纳入,直接覆盖了雇佣第三方服务商批量投放的情形。
罚则同步加重。该法第二十八条规定,违反第十二条的,责令停止违法行为、消除影响,处十万元以上一百万元以下罚款;情节严重的,处一百万元以上五百万元以下罚款。新法自 2025 年 10 月 15 日起施行。
对模型服务方也有约束依据。《生成式人工智能服务管理暂行办法》第七条要求提供者采取有效措施提高训练数据质量,增强训练数据的真实性、准确性、客观性、多样性——这条可以作为向平台反馈时的引用依据。
如果品牌有海外业务,还可以并行走搜索引擎侧。Google 在 Search Central 的垃圾内容政策中把批量生成低价值页面定义为 scaled content abuse,把借用高权重站点发布第三方内容定义为 site reputation abuse,两者都属于可举报的违规类型。
申诉路径怎么选:按信源类型分流
不同类型的污染源受理主体不同,材料要求和周期差异很大。盲目全渠道投诉不如按类型分流。
| 信源类型 | 受理主体 | 核心材料 | 常见周期 |
|---|---|---|---|
| 自媒体平台内容 | 平台侵权投诉入口 | 主体证明 + 事实反证 + 具体链接 | 3–15 天 |
| 问答/社区内容 | 平台不实信息举报 | 反证材料 + 内容批量清单 | 7–30 天 |
| 无资质聚合站 | ICP 备案地网信部门 | 举证包 + 传播时序表 | 30 天以上 |
| 有组织批量投放 | 网信办举报专区 / 市场监管部门 | 完整举证包 + 关联性分析 | 视立案情况 |
| AI 平台答案本身 | 各模型内置反馈入口 | 对话截图 + 正确信息来源 | 不确定,需重复提交 |
**实操建议:源头删除和 AI 平台反馈必须并行做。**只删源头,模型缓存的表述还会持续一段时间;只反馈平台答案,源头还在会被重新抓回来。危机窗口期内的动作次序与责任分工,可参考品牌危机时快速纠偏 AI 答案的应急响应 SOP。
对冲内容怎么做:五类反向锚定资产
对冲不是"多发正面稿"。**污染源之所以被引用,是因为它精准落在了用户问句的语义位置上;要挤掉它,你的内容必须落在同一个位置。**这是对冲能不能奏效的唯一判据。
五类真正有效的对冲资产:
- 事实校正页——针对被指控的具体断言逐条回应,标题直接采用用户会问 AI 的疑问句式,而不是公关稿式标题
- 第三方可验证凭证——检测报告、资质证书、审计意见,带机构名称和编号,能被交叉核验
- 结构化参数页——产品规格、服务条款、售后政策以结构化数据标注,降低模型误读概率
- 可核实的真实案例——客户名称、时间、可验证结果,模糊化的"某知名企业"对模型没有采信价值
- 有资质媒体与行业组织背书——对应平台来源分级中的核心采信与辅助验证层级
**三条投放要求缺一不可:同问句、同长尾、同语义空间。**内容要覆盖污染稿使用的那些具体表述,否则模型检索时两者根本不在同一个候选集里,正面内容再多也碰不到面。这套"让内容被答案引擎选中"的底层逻辑,就是答案引擎优化(AEO)在做的事,对冲只是它的防御性用法。
优先级排序公式(各项按 1–3 分打分,相乘取高分优先):
处置优先级 = 污染源权重 × AI 引用频次 × 伤害深度
一个被三个平台同时引用、直指产品安全的中等权重源,优先级远高于一个高权重但从未被引用的泛泛差评。完整的风险分级思路,可对照六类 AI 搜索品牌风险的识别信号与处置优先级。
时间账:各路径大概多久见效
预期管理比技术方案更容易出问题。给管理层一张时间表,比承诺"尽快解决"更有价值。
| 处置路径 | 首次可观测变化 | 说明 |
|---|---|---|
| AI 平台答案反馈 | 数天至数周 | 波动大,需重复提交 |
| 平台源头删除 | 1–4 周 | 删除后模型仍有惯性 |
| 网信/监管举报 | 1 个月以上 | 受理与查处不同步 |
| 对冲内容起效 | 3–8 周 | 取决于收录与信源权重 |
| 共识层稀释 | 3–6 个月 | 需要持续供给,无捷径 |
| 参数层清除 | 依赖模型迭代 | 不可控,只能长期稀释 |
三条不能碰的红线
反制过程中最容易出事的,恰恰是反击动作本身。
第一,不要以毒攻毒。《反不正当竞争法》第十二条约束的是所有经营者,对竞品做同样的投放,只是把自己也变成被处罚对象,且对方的举证包会比你更完整。
**第二,不要用 AI 批量生产对冲内容刷量。**这正是 Google 垃圾内容政策中 scaled content abuse 的定义。批量低质内容不但不会提升引用率,还会拉低整个域名在来源分级中的位置。
**第三,不要只删不建。**删除只清空了检索候选池里的一个位置,如果你不填进去,下一次污染填得更快。每删除一条,同期至少补一条覆盖同一问句的权威内容。
常见问题
问:怎么确定负面是竞品投放的,而不是真实用户吐槽?
答:看八个投放指纹的命中数量,重点看第 5 项——是否每篇都在结论段推荐同一个特定竞品。真实用户很少在批评一个品牌时统一推荐另一个具体品牌。命中 4 项以上再定性为投放型。
问:源头帖子删掉了,为什么 AI 还在说?
答:三个原因。模型有检索缓存和索引延迟;污染内容可能已被其他站点转载;如果已经进入共识层或训练语料,删除源头对模型记忆没有直接作用。用联网开关交叉验证法跑一遍就能确认是哪一种。
问:只在一个 AI 平台出现负面,需要处理吗?
答:需要,但优先级可以降。各平台信源分级和检索策略不同,单平台出现通常说明污染源权重不高、扩散尚未完成,这时候处置成本最低。等到三个以上平台同时复述,处理难度会上升一个量级。
问:小品牌没有媒体资源,怎么做对冲?
答:先把官网做成可采信信源——完整的企业信息、产品参数、资质证书、结构化数据标注,这些不需要预算。平台来源分级里"品牌备案官网"本身就属于核心采信层。在此基础上补一到两份第三方检测报告,性价比远高于投放软文。
问:全套流程需要多少人力?
答:诊断阶段(3×4×2 交叉验证 + 指纹判定)一人半天到一天。举证包整理一到两天。之后是持续监控,建议按周跑一次风险探针类 Prompt,一次约两小时。真正耗人力的是对冲内容生产,按每月两到三篇权威内容的节奏排产比较现实。
问:能不能起诉 AI 平台本身?
答:优先级最低。平台通常适用避风港规则,且举证难度高于追源头投放者。《生成式人工智能服务管理暂行办法》第七条更适合作为向平台反馈时的施压依据,而不是直接的诉讼请求。把法务火力集中在可锁定主体的投放方和服务商身上,胜算和成本都更合适。
