AI爬虫付费抓取:品牌方该放行、收费还是屏蔽(2026 决策指南)

AI爬虫付费抓取决策树:放行、收费与屏蔽三条路径的判断条件与适用内容类型

AI爬虫付费抓取指内容方通过 HTTP 402 状态码向 AI 爬虫标价,爬虫携带支付凭证才能取到正文,否则只拿到报价单。 Cloudflare 2025 年 7 月把这套机制推向公测,robots.txt 的问题从「允不允许」变成了「多少钱」。

但对品牌方来说,这道题的答案和出版商相反——多数品牌算完账会发现,收费是笔亏本买卖。本文不复述机制新闻,给三样东西:能代入自己数据的取舍测算模型、按目录差异化放行的配置模板、改完配置后判断有没有效的验证流程。

AI爬虫付费抓取决策树:放行、收费与屏蔽三条路径的判断条件与适用内容类型

AI爬虫付费抓取到底改变了什么规则

它把 robots.txt 的二元开关变成了带价格的三选项:允许、收费、屏蔽。 爬虫请求页面时不带支付意图,服务端返回 402 Payment Required 并附报价;带且价格可接受,返回 200 和正文。

技术细节写在 Cloudflare 的 pay per crawl 发布说明里,最低计价为每次成功取回内容 0.01 美元。同期上线的内容信号政策(Content Signals Policy)在 robots.txt 里新增 searchai-inputai-train 三类用途声明,让「可以进搜索索引但不许拿去训练」这种表达第一次有了标准写法。

标准层同步补齐。RSL(Really Simple Licensing)规范允许在 robots.txt 中直接写入订阅、按抓取付费、按推理付费等授权条款;IETF 的 AI Preferences 工作组在推动机器可读的用途偏好词汇成为正式标准。需求侧也开始接单——微软的 Publisher Content Marketplace 已把主流出版商接入 Copilot 的付费调用链路。

一句话概括:基础设施准备好了,但它是为出版商准备的。

出版商的账和品牌方的账,为什么算出来完全相反

因为两者的内容在损益表上位置不同:出版商的内容是营收产品,被抓走等于货被拿走;品牌方的内容是营销成本,被抓走等于广告被免费投放。

出版商的愤怒有硬数据支撑。Cloudflare 2025 年 7 月公布的抓取回流比显示,Anthropic 每带来 1 个访客要抓取约 38,000 个页面,OpenAI 约 1,100 个,而 Google 仅为个位数。对靠广告展示和订阅转化吃饭的媒体,这组数字意味着成本上升、收入下降。

但把同一组数字放进品牌方的模型里,结论会翻转。

维度 出版商 品牌方
内容的经济角色 直接变现资产 获客与信任成本
被抓取的即时损失 广告曝光、订阅转化流失 几乎为零(带宽成本除外)
被引用的收益 一次署名 + 少量回流 进入选型候选集,影响成交
内容不可替代性 高(独家报道、深度调查) 低(媒体报道、测评站、论坛可替代)
合理策略 谈授权、要分成 保放行、争引用

收费这条路,品牌方现在能不能真的走通

绝大多数品牌走不通,卡点有三个:需求方不接单、定价粒度不够、中文平台完全缺席。

第一个卡点是需求侧。 AI 公司为独家新闻、专业数据库、图库付费,是因为这些内容不可替代。品牌官网的产品页、定价页、帮助文档,替代品遍地都是。挂上 402 之后最可能的结果不是收到钱,而是爬虫掉头就走。

第二个卡点是产品能力。 按 Cloudflare 官方文档核对后可确认两件事:pay per crawl 的定价是 zone 级的,不支持按目录或按路径设不同价格;且 WAF 与 Bot Management 规则会覆盖计费逻辑,直接拦截而非收费。「文档免费、研究报告收费」这种精细策略,当前只能靠拆分子域名(把付费内容放到独立 zone)实现,运维成本不低。更基础的问题是规则打架导致 AI 爬虫收到 403 而不是 402,排查思路见CDN 与 WAF 误拦截 AI 爬虫的检查清单

第三个卡点最致命:中文 AI 生态里没有付费抓取通道。 DeepSeek、豆包、Kimi、通义千问及其背后的抓取器,既没有接入 Cloudflare 的计费市场,也没有对应的国内结算方。对以中文市场为主的品牌,「收费」这个选项在技术上不存在,实际只有放行和屏蔽两条路。

一个可代入的取舍框架:授权收益 vs 被引用的营销价值

决策公式:当「预期授权收益」小于「失去引用导致的曝光损失」时,就应该放行。 下面两侧测算可直接代入自己的数据。

授权收益侧:

年度授权收益 = 月度 AI 爬虫抓取次数 × 单次定价 × 实际付费率 × 12

以一个 820 个可索引 URL 的 B2B SaaS 站点为例(以下参数为示例假设,非实测值):月抓取量 38,000 次,按 0.01 美元下限计价,理论月收入约 380 美元。但多数爬虫收到 402 会直接放弃,按 15% 的实际付费率折算,真实到账约每月 400 元人民币。

引用价值侧:

月度曝光等价值 = 品类高意图 prompt 月触发量 × 品牌提及率 × 单次曝光等效 CPC

同一站点:核心品类高意图 prompt 约 200 个,估算月触发量 30,000 次,当前品牌提及率 22%,即每月约 6,600 次品牌出现。若因屏蔽跌至 6%(仅靠第三方信源残留),净减少 4,800 次。按品牌词等效 CPC 8 元折算,每月损失约 3.8 万元的曝光等价值。

两侧对比接近 95:1。即便把等效 CPC 保守压到 2 元,仍有 24:1 的差距。结论对绝大多数品牌明确:不要收费,也不要屏蔽。

代入时最容易错的是「品牌提及率」这一项——它不等于引用率,一个衡量你被不被说到,另一个衡量你被不被链接,两者的分工差异决定了你该往哪边优化。

按内容类型分档,而不是全站一刀切

真正需要区分的是内容类型。按「被引用的营销价值」和「内容稀缺性」两轴拆开,得到四种处置:

象限 内容示例 建议动作
高营销价值 + 低稀缺性 产品页、定价说明、对比页、帮助文档、FAQ 全量放行,三类信号全开
高营销价值 + 高稀缺性 原创行业研究、一手调研数据、基准测试 放行检索、限制训练,保留署名主张
低营销价值 + 高稀缺性 付费数据库、会员专属内容、内部知识库 屏蔽或走正式授权谈判
低营销价值 + 低稀缺性 站内搜索页、参数页、过期活动页、UGC 噪声 屏蔽,避免污染答案

第一象限里最该优先放行的是对比页和替代品页——这类页面直接进入选型环节,结构写对了 AI 会成段引用

第二象限的取舍值得展开:训练用了你的内容不会给链接,检索用了才会给引用来源。所以对原创研究设 ai-train=no + ai-input=yes 是理性的。但要清楚代价——模型不联网时依赖训练语料里的旧印象,长期把自己排除在训练之外,会让模型对你的产品认知冻结在屏蔽前那一版。

分目录差异化放行的配置怎么写

核心思路:用 Content Signals 表达用途偏好,用 robots.txt 的 Disallow 处理噪声目录,两者分工不重叠。 下面是一份可直接改造的模板。

# Content signals per path group
User-agent: *
# 产品与转化路径:全开
Allow: /product/
Allow: /pricing/
Allow: /compare/
Allow: /docs/
Content-Signal: search=yes, ai-input=yes, ai-train=yes

# 原创研究:允许检索引用,拒绝训练
Allow: /research/
Content-Signal: search=yes, ai-input=yes, ai-train=no

# 噪声与私域:直接不放行
Disallow: /search
Disallow: /*?filter=
Disallow: /account/
Disallow: /cart/
Disallow: /promo/archive/
Content-Signal: search=no, ai-input=no, ai-train=no

要进一步声明授权条款,可在同一文件挂 RSL 许可指向:

License: https://example.com/license.xml

落地顺序按下面五步执行:

  1. 先做资产盘点。 把全站 URL 按上表四象限归类,输出一张目录级清单,这一步决定后面所有配置。
  2. 清理噪声目录。 把站内检索、筛选参数、失效活动页全部 Disallow——这部分收益最确定,能直接降低 AI 答案里出现过期信息的概率。
  3. 打开高价值目录的三类信号。 产品、定价、对比、文档四类优先。
  4. 核对拦截链路。 确认 CDN、WAF、Bot Management 没有在 robots.txt 之外二次拦截,具体 UA 取舍逻辑见按业务目标决定 GPTBot、ClaudeBot 与 Bytespider 放行策略
  5. 最后再考虑收费。 且只对第三象限内容、且只在拆出独立 zone 之后。

还要检查的一件事:你的页面在无 JS 时有没有正文。 大量 AI 爬虫不执行 JavaScript,配置放行了但正文靠客户端渲染,抓到的仍是空壳——SSR 与 CSR 对 AI 爬虫可见度的差别是先决条件,不解决它,放行配置写得再细也没意义。

robots.txt 中 search、ai-input、ai-train 三类内容信号的作用范围对比示意图

search、ai-input、ai-train 三类信号有什么区别

三者管内容的三种用途:search 管进不进搜索索引,ai-input 管能不能被实时检索后写进答案,ai-train 管能不能进训练语料。 混淆它们是配置出错的头号原因。

信号 管辖用途 关掉后的影响 生效时滞
search 传统搜索索引 自然排名消失 数天到数周
ai-input 联网检索与引用 AI 答案不再引用你的页面 当天到数天
ai-train 模型训练与微调 下一代模型对你的认知停留在旧版本 数月到一整个训练周期

最后一列是实操中最容易踩坑的地方。关掉 ai-input 的影响几乎立刻可见,关掉 ai-train 的影响要等下一个模型版本才显现——如果你同时改两个信号再去看数据,看到的全是 ai-input 的效果,ai-train 的代价半年后才找上门。

还要注意信号的法律性质。Cloudflare 明确说明内容信号表达的是偏好而非技术拦截手段,部分公司可能直接忽略——声明和执行是两回事。另一个变量是 Google:Google-Extended 只管 Gemini 训练,管不到 AI Overviews,而 AI Overviews 长期复用常规搜索索引。这意味着「退出 AI 答案」和「留在自然排名」在很长时间里是同一个开关的两端,动它之前先量清楚 AI Overviews 到底吃掉了你多少点击——怎么在 GSC 里把 AIO 点击损失和排名下滑分开是这个决策的前置数据。

改完配置之后,怎么验证到底有没有效

用两条独立数据轨判断:供给侧看服务端日志里的爬虫行为,需求侧看 AI 答案里的提及与引用变化。只看其中一条会得出错误结论。

供给侧的核心指标是各 AI 爬虫的 2xx 成功率,按 User-Agent 加 ASN 分组统计抓取量、状态码分布、402/403 占比。需求侧要跑固定 prompt 集,测量提及率、引用率和引用来源域名分布。

一个 4 周的最小验证设计:

  1. 第 0 周建基线。 固定一组 prompt(品牌词与非品牌词各半),在 DeepSeek、豆包、Kimi、通义千问上各跑 3 轮取中位数;同时导出前 30 天的爬虫访问日志。品牌词与非品牌词回答的问题不同,前者测认知准确度、后者测能不能被发现,混在一起看会误判。
  2. 第 1 周只改一组目录的信号。 例如把 /docs/ 从 Disallow 改为全开,其余配置一律不动——同时改多处会让归因失效。
  3. 第 2–3 周观察供给侧。 检索型爬虫的抓取量和 2xx 成功率应在数天内变化;若毫无动静,说明信号没生效或被上游规则覆盖。
  4. 第 4 周复测需求侧。 对比提及率与引用率;训练侧影响不在本窗口内评估,需要单独跨版本追踪。

结果判读照这张表对号入座:

观察到的现象 最可能的原因 下一步动作
抓取量↑,引用率不变 内容可抓但不可引 检查段落自包含性与可信度信号
抓取量无变化 信号未生效或被 WAF 覆盖 排查 CDN / 防护规则链路
引用率↑,提及率不变 被当素材,未被当推荐对象 补充对比类与选型类内容
两者都↑,成交无变化 触达的 prompt 意图偏低 重构 prompt 集,加高意图场景

第一行最常见。抓得到不等于引得动——模型选哪一段引用,取决于作者署名、结构化数据、排名和新鲜度这组信号,同样被抓取的两个页面,一个被反复引用、另一个从不出现,差别就在这里。

最后提醒一条:不要用网站总流量衡量这类改动的效果。 AI 爬虫的抓取不产生可见访问,AI 答案里的品牌提及也不一定带来点击。用流量看,你只会看到「什么都没发生」。

常见问题

小品牌站开启付费抓取能赚到钱吗?

基本不能。按 0.01 美元的计价下限,一个几百页规模的站点即使被足额抓取,理论月收入也只有几百元人民币,还要乘一个很低的实际付费率。同时你会失去被 AI 引用的机会,两边一算通常净亏。付费抓取的合理适用对象是内容规模大、原创度高、且内容本身就是主营收入的媒体和数据方。

屏蔽了训练爬虫,品牌会不会在 AI 里「消失」?

不会立刻消失,但会慢慢过时。屏蔽 ai-train 只影响下一代模型的训练语料,不影响联网检索。后果是模型在不联网状态下对你的认知冻结在屏蔽前那一版——产品改名、定价调整、新功能上线,模型都不知道。对迭代快的品牌,这个代价通常大于收益。

robots.txt 里写 ai-train=no 有法律效力吗?

它是一份机器可读的意愿声明,本身不是技术拦截,也不自动等同于具有强制力的合同。它的价值在于:一旦发生争议,你有一份带时间戳、可公开验证的拒绝记录。要获得可执行的约束力,需要走 RSL 这类明确的授权条款声明,或直接签订授权协议。

中文 AI 平台能不能按目录精细控制?

只能做到粗粒度控制。DeepSeek、豆包、Kimi 等平台既未接入付费抓取市场,对 Content Signals 的支持情况也不明确,可靠的手段仍是 robots.txt 的 Allow / Disallow 加服务端 UA 规则。实操建议:先把噪声目录关掉,高价值目录保持全开,然后用日志验证各 UA 的实际遵守情况。

屏蔽 AI 爬虫会影响 Google 和百度的自然排名吗?

取决于屏蔽的是谁。屏蔽 GPTBot、ClaudeBot 这类独立 AI 爬虫不影响传统搜索排名。但屏蔽 Googlebot 或 Baiduspider 会同时切断搜索索引——Google 的 AI Overviews 复用常规搜索索引,退出 AI 答案往往意味着一并退出自然搜索。配置前务必确认 UA 归属。

已经开了付费抓取,怎么回退?

先关计价、再验放行。顺序是:在 Cloudflare 关闭 pay per crawl 计费 → 检查 WAF / Bot Management 里有没有残留的 AI 爬虫拦截规则(这是最常见的回退失败原因)→ 用日志确认目标 UA 拿到 200 而不是 402/403 → 等 2–4 周复测提及率。检索型爬虫恢复较快,训练侧影响要到下一个模型版本才可能回补。