AI爬虫白名单配置:从 robots 到 WAF 的放行顺序

AI爬虫白名单配置:从 robots 到 WAF 的放行顺序

AI爬虫白名单配置的关键,不是把所有 AI 流量都放行,而是先分清训练抓取、实时检索和索引抓取,再决定让谁、抓哪一段、用什么方式通过。只改 robots.txt 往往不够,真正生效的是 WAF/CDN、源站鉴权和日志验收。若站点目前连抓取都不通,可先对照AI爬虫抓不到网站的七层排查

AI爬虫白名单配置示意:robots、WAF、源站三层关系

什么是 AI爬虫白名单配置?

AI爬虫白名单配置,指的是把你希望 AI 系统读取的公开页面,按爬虫身份和目录范围逐层放行。它不是“所有机器人都能进”,而是“该放行的公开内容放行,不该暴露的内容继续拦”。

Google 也明确区分了“允许抓取”和“保护私密内容”两件事:robots.txt 只负责爬取层面,真正的私密内容应通过密码保护或源站鉴权处理。可参考 Google Search Central 的内容共享说明Google 对 robots.txt 的规范解释

先分清:你要放行的是训练爬虫,还是检索爬虫?

先把爬虫分层,才不会把白名单配成一刀切。训练爬虫影响的是“以后模型怎么记住你”,检索爬虫影响的是“这一次回答里有没有你”,两者的业务后果完全不同。

类型 典型作用 建议
训练抓取 进入模型语料,影响长期认知 公开内容可放,敏感价格页慎放
实时检索 生成当次回答和引用 公开品牌页、FAQ、案例页优先放行
搜索索引 让底层搜索能找到你 不要误伤,很多 AI 回答依赖它

RankEcho 和 MaxAEO 的日志抽样都提示过一件事:只看 User-Agent 不够,很多 AI 请求会伪装成普通浏览器,或者根本不带明显标识。也就是说,AI爬虫白名单配置不能只做“字符串匹配”,还要配合日志核验。

一份可落地的放行顺序

最稳的顺序,是先让公开内容可达,再收紧私密内容边界。

  1. 先放公开目录:博客、文档、FAQ、案例页、帮助中心。
  2. 再给 WAF/CDN 做身份白名单:UA 只是起点,最好叠加反向 DNS、ASN、验证过的 bot 类别。
  3. robots.txt 只做目录声明:它适合表达“哪些路径可抓”,不适合替代安全层。
  4. 源站继续保护私密页:会员、后台、结算、内部资料,直接用鉴权,不要依赖 robots。

如果你在 Cloudflare 上做这件事,顺序感尤其重要。Cloudflare 官方文档写得很清楚:WAF 规则在前,AI Crawl Control 在后。也就是说,WAF 先挡住了,请求就根本到不了后面的策略层。可对照 Cloudflare AI Crawl Control 与 WAF 的顺序说明

# 公开内容示例
User-agent: GPTBot
Allow: /blog/
Allow: /docs/

User-agent: Claude-User
Allow: /blog/
Allow: /docs/

User-agent: *
Disallow: /account/
Disallow: /checkout/

哪些页面该放行,哪些页面该拦?

判断标准只有一个:这个页面是否应该被 AI 复述给用户。公开品牌信息应该放行,敏感交易信息不该放行。

页面类型 动作 原因
产品页、博客、FAQ、案例 放行 这是 AI 最需要复述的内容
技术文档、帮助中心 放行 直接影响引用准确率
价格页、库存页 限速或分层放行 变动频繁,避免过期数据扩散
会员页、后台、结算页 拦截并鉴权 这不是给 AI 看的公开内容
搜索结果页、筛选页、打印页 拦截 浪费抓取预算,信息增量低

如果你的站点是国产 AI 场景,还可以再看一篇更细的目录策略:国产 AI 爬虫 robots 怎么写:UA 清单、放行限速与分目录取舍。它讲得更偏“按目录决策”,适合已经有站点结构的人直接套用。

最容易踩的 3 个误区

第一,只改 robots,不改 WAF
这是最常见的误判。robots 写得再好,WAF 还在前面拦,结果还是 403。

第二,把所有 AI 都当成一类
训练爬虫和检索爬虫的目标不同,建议也不同。该拦训练,不代表该拦实时取回。

第三,放行 HTML,却挡住了静态资源
很多渲染型爬虫需要 JS、CSS 才能还原正文。只放页面、不放资源,等于让 AI 看到半张图。若你怀疑是这个问题,可以直接看 网站能被百度和谷歌抓取,却被 AI 爬虫返回 403:CDN 与 WAF 误拦截排查清单

如果站点在 Cloudflare 上,另一篇 Cloudflare 拦截 GPTBot 的排查思路 也值得一起看。

怎么验收,才算真的配对了?

只看“能不能访问”还不够。更可靠的做法,是看三层信号:日志、引用、可见度。

MaxAEO 对 42 个中文站点、61 天访问日志做过抽样核对,发现风控层是最高频断点,占失败样本 41.5%;前四层修复后,可覆盖 74% 的失败站点。这个结论的价值不在数字本身,而在于它说明:AI爬虫白名单配置的核心,往往不是 robots,而是 WAF 与源站边界

验收信号 观察内容 常见周期
一级 服务器日志出现目标爬虫 UA,且返回 200 3–14 天
二级 AI 回答中开始出现你的域名或品牌名 2–6 周
三级 目标问题集上的可见度与引用回升 4–10 周

如果你还想把“可达”进一步变成“可被模型优先理解”,再考虑 llms.txt 到底要不要写。但要记住:它是信息导航,不是放行开关。

常见问题

只改 robots.txt 够吗?

不够。robots 只是声明,WAF、CDN、源站鉴权才是真正的执行层。

白名单要不要放行所有 AI 爬虫?

不要。公开内容可以放,私密页、交易页、内部资料不该放。

看到 403 但已经加白,为什么还是不通?

优先查上游规则:WAF、CDN、跳转规则、JS 挑战、静态资源是否被拦。

什么时候该用限速,而不是直接拦截?

当你想保留 AI 访问,但担心成本、频次或过期数据时,限速通常比一刀切更合理。

AI爬虫白名单配置后,多久能看见效果?

日志层面通常先变,AI 引用和可见度会滞后几周。不要只手工问一次 AI,就下结论。