Cloudflare 机器人白名单配置:搜索爬虫与 AI 爬虫放行指南

Cloudflare 机器人白名单配置:搜索爬虫与 AI 爬虫放行指南

作者:maxaeo.cn|发布日期:2026-08-31|更新日期:2026-08-31

Cloudflare 机器人白名单配置的核心不是“全部放行”,而是把可信搜索爬虫、AI 爬虫、监控探针和业务 API 分层处理:能用官方识别字段放行的不用 IP 白名单,能限速的不要直接关闭防护。

Cloudflare 机器人白名单配置分层示意图

什么是 Cloudflare 机器人白名单配置?

Cloudflare 机器人白名单配置指在 Cloudflare WAF、Bot 管理、AI Crawl Control 等能力中,允许可信自动化访问通过,同时继续拦截恶意爬虫、撞库脚本和异常扫描流量。

常见误区是把“机器人”看成一个整体。实际上,Googlebot、Bingbot、站点监控、支付回调、AI 搜索爬虫和匿名采集脚本的风险完全不同。Cloudflare 官方文档中,Verified Bot 可通过 cf.client.bot 或 Bot Management 字段识别;AI 爬虫则可在 AI Crawl Control 中单独查看和允许或阻止。

更稳妥的做法是:先识别访问目的,再决定 Allow、Skip、Managed Challenge、Rate Limit 或 Block。这比简单加 IP 白名单更安全,也更容易复盘。

什么时候需要给机器人放行?

当合法机器人被挑战、403、限速或无法抓取关键页面时,才需要放行;如果只是看到机器人访问日志增加,不应立即关闭 Bot Fight Mode 或 WAF。

适合放行的场景包括:

  1. 搜索引擎收录异常,日志显示 Googlebot 或 Bingbot 被挑战。
  2. AI 搜索平台无法读取官网、文档、定价页或帮助中心。
  3. Uptime 监控、性能探针、支付回调被误判为机器人。
  4. 自有爬虫、合作方 API 或营销自动化系统触发 WAF。
  5. 开启 Bot Fight Mode 后,正常 API、预览工具或监控服务出现 403。

如果问题出在 Bot Fight Mode,可参考站内的 Cloudflare Bot Fight Mode 放行误拦修复方案。如果是 AI 平台抓取失败,则应结合 AI 爬虫访问被拦截排查指南 一起检查 robots.txt、WAF 和源站日志。

放行前先做三层判断

放行前建议用“身份、路径、行为”三层判断。身份确认它是谁,路径确认它访问什么,行为确认它是否过量或异常。

判断层 要看什么 推荐动作
身份 是否为 Verified Bot、公开 UA、固定回调 IP、已知监控服务 优先用官方字段或供应商 IP 验证
路径 是否只访问 /blog//docs//pricing//api/ 按路径最小授权
行为 频率、状态码、User-Agent 是否伪装、是否忽略 robots.txt 正常放行,异常限速或挑战

这套矩阵的价值在于避免“一条 Allow 规则放穿全站”。例如 AI 爬虫需要读取公开内容,不代表它应该访问登录接口、后台路径、搜索接口或高成本动态页面。

基础方案:放行 Cloudflare Verified Bot

可信搜索爬虫优先使用 Verified Bot 字段放行。Cloudflare 在 WAF 示例中说明,可用 cf.client.bot 判断请求是否来自已知良性机器人,如 Googlebot、Bingbot 等。

一个常见规则思路是:对高风险国家、异常路径或 Bot 分数较低的请求发起挑战,但排除已验证机器人。表达式可参考 Cloudflare 的 允许搜索引擎和其他 Verified Bot 的 WAF 示例

(ip.src.country in {"US" "MX"} and not cf.client.bot)

这条规则的含义不是“只允许美国和墨西哥”,而是示范如何在挑战规则里排除可信机器人。实际配置时,应替换为自己的风险条件,例如敏感路径、异常 ASN、低信誉流量或过高请求频率。

AI 爬虫应该怎样放行?

AI 爬虫不建议一刀切放行。更合理的配置是:允许能带来引用、推荐或品牌曝光价值的 AI 爬虫访问公开内容,同时限制训练型、高频或不遵守 robots.txt 的抓取。

Cloudflare 的 AI Crawl Control 文档 显示,它可查看哪些 AI 服务访问站点,并对单个爬虫设置 allow 或 block;其 Crawlers 页还可按爬虫、运营方、路径和时间过滤请求。Cloudflare 也说明,免费计划主要基于 User-Agent 识别 AI 爬虫,付费 Bot Management 可使用更深入的检测字段。

对希望进入 AI 搜索答案的 SaaS 站点,建议保留这些公开路径:

  • /
  • /product/ 或产品介绍页
  • /pricing/ 或套餐页
  • /docs//help//blog/
  • /llms.txt/robots.txt/sitemap.xml

同时限制这些路径:

  • /admin/
  • /login/
  • /api/
  • /search
  • 带大量筛选参数的动态 URL

如果需要整理国产 AI 平台的爬虫识别信息,可参考 国产 AI 爬虫 UA 大全与 WAF 白名单配置;如果重点是 DeepSeek,可继续看 DeepSeek 爬虫抓取协议配置指南

Cloudflare AI 爬虫放行路径与限制路径对照

WAF 自定义规则怎么写更稳?

WAF 自定义规则应遵循“允许可信身份、限定访问范围、保留安全检测”的原则。不要用一个 User-Agent 字符串直接 Allow 全站,因为 UA 很容易伪造。

更稳的规则顺序如下:

  1. 先允许 Cloudflare Verified Bot
    cf.client.bot 或 Bot Management 的 verified bot 字段排除搜索引擎和可信服务。

  2. 再处理已知业务回调
    对支付、监控、邮件、CRM 等服务,优先使用供应商公布 IP 段、签名 Header 或固定路径。

  3. 对 AI 爬虫做路径级放行
    公开内容可放行,登录、后台、API 和搜索结果页不放行。

  4. 最后处理可疑自动化流量
    对高频、低分、无 Referer、异常 UA 的请求使用 Managed Challenge、Rate Limit 或 Block。

一个路径级思路可以写成:

(cf.client.bot and http.request.uri.path in {"/" "/robots.txt" "/sitemap.xml"})

实际生产环境不建议直接照抄,应结合 Zone、路径结构、缓存策略和业务回调验证方式调整。

Bot Fight Mode 与白名单有什么关系?

Bot Fight Mode 是自动化机器人防护能力,白名单是对误伤流量的例外处理。若开启后出现误拦,应先确认是否能用 WAF Skip、路径排除或 Verified Bot 解决,而不是直接关闭全站防护。

Cloudflare 文档中还提到,AI bot policies 可按训练、搜索等行为设置策略;旧的 Block AI bots 设置标注为将于 2026 年 9 月 15 日弃用。由于本文发布日期是 2026 年 8 月 31 日,配置时应优先查看后台当前可用的 Security Settings 与 AI Crawl Control 选项。

对大多数内容站和 SaaS 官网,推荐策略是:

  • 搜索引擎:放行 Verified Bot。
  • AI 搜索爬虫:公开内容允许,敏感路径限制。
  • 训练型高频爬虫:按策略阻止或限速。
  • 自有监控:用固定 IP、Header 或路径放行。
  • 未知爬虫:默认挑战或限速。

如何验证白名单是否生效?

白名单是否生效不能只看“没有报错”。应同时验证状态码、Cloudflare 事件、源站日志和 AI/搜索侧抓取结果。

可按这份 12 项清单复测:

  1. 目标 URL 返回 200,而不是 403、429、503。
  2. Cloudflare Security Events 中规则命中符合预期。
  3. 源站日志能看到对应机器人请求。
  4. robots.txt 未禁止目标路径。
  5. sitemap.xml 可访问。
  6. HTML 未被 JS 挑战页替代。
  7. CDN 缓存未返回旧的阻断页面。
  8. 关键页面 Canonical 正确。
  9. AI 爬虫没有访问后台或 API 路径。
  10. 请求频率未冲击源站。
  11. 放行规则有命名、备注和负责人。
  12. 7 天后复查抓取量、引用来源和异常状态码。

对关注 AI 搜索可见性的品牌,还应监测“放行后是否真的被 AI 引用”。MaxAEO 支持监测豆包、DeepSeek、腾讯元宝、通义千问、文心一言等国产 AI 中品牌的提及率、排序、情绪评价与引用来源,可用于观察配置调整后的趋势变化。

一套适合 SaaS 官网的推荐配置

SaaS 官网通常既要防攻击,又要让搜索引擎和 AI 平台理解产品信息。推荐采用“公开内容可读、交易与后台受保护、异常访问可限速”的配置。

建议基线如下:

区域 示例路径 策略
品牌与产品页 //product//pricing/ 搜索爬虫和高价值 AI 爬虫可访问
内容与文档 /blog//docs//help/ 可访问,必要时限速
协议文件 /robots.txt/sitemap.xml/llms.txt 必须可访问
账户区域 /login//admin//dashboard/ 不对机器人放行
API 与搜索 /api//search 默认不放行,业务回调单独处理

如果站点正在布局 AI 搜索,还可以补充 llms.txt。写法可参考 llms.txt 模板与配置指南,但要记住:llms.txt 只是表达内容结构偏好,不能替代 Cloudflare 层面的访问控制。

SaaS 官网 Cloudflare 机器人白名单配置检查清单

常见问题

Cloudflare 白名单应该用 IP 还是 User-Agent?

优先用 Cloudflare Verified Bot、官方验证字段、供应商公布 IP 或签名 Header。单独依赖 User-Agent 风险较高,因为 UA 可以伪造,只适合作为辅助条件。

AI 爬虫全部放行会提升 AI 搜索曝光吗?

不一定。放行只能解决“抓不到”的问题,不能保证被推荐。AI 是否引用还取决于内容结构、实体一致性、外部信源、页面可读性和竞品对比信息。

开启 Bot Fight Mode 后搜索收录下降怎么办?

先查 Cloudflare Security Events 和源站日志,确认是否误拦 Verified Bot。若确有误伤,优先设置 Skip 或 WAF 例外规则,不建议直接关闭全部机器人防护。

robots.txt 允许了,为什么还是 403?

robots.txt 只表达抓取许可,不会绕过 WAF、Bot Fight Mode、访问规则或源站鉴权。若 AI 爬虫或搜索爬虫仍返回 403,应继续排查 Cloudflare 规则、源站防火墙和 CDN 缓存。

MaxAEO 能帮忙看 AI 爬虫放行后的效果吗?

MaxAEO 提供 AI 搜索可见性监测与诊断,可分析品牌在国产及海外 AI 平台中的提及率、排序、情感和引用来源。用户可在 maxaeo.cn 官网 获取免费诊断,建立放行前后的对比基线。

配置结论

Cloudflare 机器人白名单配置的最佳实践是分层放行:搜索引擎依赖 Verified Bot,AI 爬虫按价值和路径控制,业务回调用可验证身份放行,未知自动化流量继续挑战或限速。

真正有效的配置不是让机器人“都能进”,而是让该被搜索和 AI 理解的公开内容稳定可读,同时让后台、API、登录和高成本动态页面继续受保护。完成配置后,至少用 7 天日志和 AI 引用变化复测,避免只修好了 403,却没有形成搜索与 AI 可见性的实际收益。