Cloudflare Verified Bots 怎么开启:放行可信机器人配置指南

Cloudflare Verified Bots 怎么开启:放行可信机器人配置指南

作者:maxaeo.cn|发布日期:2026-08-28|更新日期:2026-08-28

Cloudflare Verified Bots 怎么开启?最稳妥的做法不是给所有 User-Agent 加白名单,而是在 Cloudflare 的 Bot/WAF 规则里识别“已验证机器人”,再按搜索、监控、AI 抓取等用途分层放行。

Cloudflare Verified Bots 怎么开启的仪表盘与 WAF 规则示意图

什么是 Cloudflare Verified Bots?

Cloudflare Verified Bots 是 Cloudflare 确认身份和行为相对可信的自动化访问者,例如搜索引擎爬虫、监控服务、SEO 工具和部分 AI 相关机器人。

根据 Cloudflare Verified bots 官方文档,一个机器人要被验证,通常需要满足两类条件:可确定的身份声明,以及不滥用访问权限。验证方式包括 Web Bot Auth、公开 IP 列表配合稳定 User-Agent、反向 DNS 等。

这意味着:Verified Bots 不是“永远安全”,而是“身份更可信”。站长仍然要结合业务目标决定是否允许它访问全站、仅访问公开内容,还是限制频率。

Cloudflare Verified Bots 怎么开启?

开启思路分两种:有 Bot Management 的站点可在 Bot 相关设置中配置 Verified bots;更多站点则通过 WAF 自定义规则使用 cf.client.bot 或机器人分类字段放行。

常见路径如下:

  1. 登录 Cloudflare Dashboard,选择目标站点。
  2. 进入 Security
  3. 查看 BotsSecurity Settings 中的 Bot traffic 设置。
  4. 如果界面提供 Verified bots 选项,按业务目标选择 Allow、Log、Challenge 或 Skip。
  5. 如果没有独立开关,进入 WAF → Custom rules,用规则表达式放行可信机器人。
  6. 保存后到 Security Events 观察是否还有 403、Managed Challenge 或 Block。

Cloudflare 在 WAF 示例中说明,可用 cf.client.bot 判断请求是否来自已知的良性机器人或爬虫;官方示例表达式是按国家挑战流量,但排除 cf.client.bot,详见 Cloudflare 放行搜索引擎与 verified bots 的 WAF 文档

推荐规则:先放行可信机器人,再拦截高风险流量

实操中,最容易出错的是先写了“强拦截规则”,再尝试补白名单。更安全的顺序是:先定义可信流量例外,再对高风险自动化访问执行挑战或拦截。

可从这条基础表达式开始:

cf.client.bot

动作建议选:

场景 建议动作 说明
只想避免误拦 Googlebot、Bingbot Skip 或 Allow 跳过后续会误伤的 WAF/Bot 规则
希望观察真实影响 Log 先记录 3–7 天再放行
担心伪装爬虫 不用 UA 白名单单独放行 仅凭 User-Agent 容易被伪造
Enterprise Bot Management 使用 cf.bot_management.verified_bot 可结合 Bot Score 做更细粒度策略

Cloudflare 的 Bot Management 变量文档说明,cf.bot_management.verified_bot 是布尔值,用于表示请求是否来自 Cloudflare 允许的机器人;同时还有 cf.verified_bot_category 可按类型区分流量,见 Cloudflare Bot Management variables

AI 爬虫要不要跟普通搜索爬虫一起放行?

不建议一刀切。AI Search、AI Assistant、AI Crawler 的价值和风险不同:搜索与问答引用可能带来曝光,训练型抓取则未必直接带来可见流量。

Cloudflare 的 AI Crawl Control 文档列出 GPTBot、ChatGPT-User、OAI-SearchBot、ClaudeBot、Claude-SearchBot、PerplexityBot、Bytespider 等不同机器人,并区分 AI Crawler、AI Assistant、AI Search 等类别,详见 Cloudflare AI bot reference

一个更适合 SaaS 官网和内容站的策略是:

  • 允许 Search Engine Crawler:保留传统搜索收录。
  • 谨慎允许 AI Search / AI Assistant:用于实时问答、引用、产品推荐场景。
  • 单独评估 AI Crawler / Training:如果担心训练用途,可限制或阻止。
  • 保留 robots.txt 与 WAF 同步检查:避免协议允许但边缘层拦截。

如果你的问题不是“能不能抓”,而是“抓了以后 AI 有没有提到品牌”,可以把抓取验证和后续曝光监测拆开。MaxAEO 的 AI 爬虫访问被拦截排查指南 更偏向从 robots.txt、WAF、403 和日志层定位失败原因。

AI 搜索爬虫、搜索引擎爬虫与训练型机器人放行策略对比图

一手排查框架:用“四层法”确认是否真的生效

在 SaaS 官网排查里,很多团队以为“开了 Verified Bots 就等于 AI 能引用”,但实际常卡在 WAF、缓存、robots.txt 或内容可读性。更可靠的验证是四层同步检查。

第一层:Cloudflare 事件层。
在 Security Events 里筛选被拦截的请求,看 Action 是 Block、Managed Challenge、JS Challenge 还是 Rate Limit。重点查看 Bot 字段、User-Agent、Path、触发规则名称。

第二层:源站日志层。
如果 Cloudflare 显示 Allow,但源站没有访问记录,说明请求可能被缓存、Worker、规则或上游代理处理。若源站返回 403,则不应只改 Cloudflare。

第三层:协议层。
检查 robots.txt、llms.txt、canonical、noindex、登录墙和地区限制。对大模型友好的内容结构,可参考 llms.txt 语法规范 做信息入口整理。

第四层:AI 回答层。
抓取成功不等于会被引用。还要复测目标问题下品牌是否被提及、排序是否变化、引用来源是否更新。MaxAEO 支持监测豆包、DeepSeek、腾讯元宝、通义千问、文心一言等国产 AI 中品牌的提及率、排序、情绪评价与引用来源,适合做上线后的趋势验证。

配置模板:搜索放行、AI 分流、恶意机器人挑战

如果目标是“保护站点,同时不挡住搜索和 AI 可见性”,可以用三条规则分层,而不是一条规则解决所有问题。

规则 1:放行已验证搜索与监控机器人

cf.client.bot

动作:Skip。
跳过项:容易误伤机器人的自定义 WAF 规则、Bot Fight 相关动作或速率限制规则。实际可跳过哪些组件,取决于你的 Cloudflare 套餐与界面选项。

规则 2:按 AI 类别分流

cf.verified_bot_category in {"AI Search" "AI Assistant"}

动作:Allow 或 Log。
建议先 Log 3–7 天,观察是否访问产品页、文档页、价格页、博客页等关键路径。若只访问无价值路径,再加路径限制。

规则 3:挑战低分自动化访问

Enterprise Bot Management 可参考:

cf.bot_management.score lt 30
and not cf.bot_management.verified_bot
and not starts_with(http.request.uri.path, "/api")

动作:Managed Challenge。
这类规则的重点是 排除 verified bot、排除 API 或健康检查路径,避免把监控、支付回调、搜索爬虫一并拦掉。Cloudflare 的“Challenge bad bots”用例也采用了“低 Bot Score 且非 verified bot”的思路。

常见误区:为什么开了仍然 403?

开了 Verified Bots 后仍然 403,通常不是一个开关没打开,而是多条规则叠加。Cloudflare 的处理链路里,WAF、自定义规则、托管规则、Bot 规则、Rate Limiting、Transform、Worker、源站权限都可能参与。

优先检查这 5 个点:

  1. Block AI Bots 是否仍在生效:它可能拦截部分 AI 相关机器人。
  2. 自定义 WAF 规则顺序是否错误:放行规则应位于会误伤的拦截规则之前。
  3. 是否只按 User-Agent 放行:伪装 UA 太容易,建议使用 Cloudflare 字段或分类。
  4. 是否源站自己拦截:Nginx、应用防火墙、插件、鉴权中间件都可能返回 403。
  5. 是否把 API、登录、静态资源混在同一策略:不同路径应有不同动作。

如果已经出现 AI 搜索抓取失败,可结合 大模型抓取 403 原因排查 从 Cloudflare、源站、协议和内容四层定位。

放行后怎么判断对 AI 可见性有帮助?

判断标准不是“机器人访问量上涨”,而是目标问题下品牌是否被更稳定地提及、是否靠前、AI 是否引用了你希望它读到的页面。

建议建立 10 个问题的基线,例如:

  • “适合中小 SaaS 的项目管理工具有哪些?”
  • “某某品牌和竞品 A 有什么区别?”
  • “某某产品适合哪些团队?”
  • “某某品牌价格、功能和安全性怎么样?”

每次调整 Cloudflare、robots.txt、llms.txt 或官网内容后,用同一批问题、同一批平台复测。MaxAEO 提供免费品牌 AI 诊断报告,支持针对品牌及竞品在真实问题下的表现做基线实测,并拆解引用来源;也可通过 国产 AI 爬虫 UA 大全 补充识别国内 AI 平台访问线索。

常见问题

Cloudflare Verified Bots 是免费功能吗?

不完全取决于一个答案。部分 verified bot 识别和分类能力会出现在不同 Bot/WAF 功能中,但更细的 Bot Score、cf.bot_management.verified_bot 等能力通常与 Bot Management 套餐有关。实际以你的 Cloudflare 控制台可见选项为准。

cf.client.botcf.bot_management.verified_bot 有什么区别?

cf.client.bot 常用于判断请求是否来自已知良性机器人;cf.bot_management.verified_bot 是 Bot Management 字段,表示请求是否来自 Cloudflare 允许的机器人。能用哪个字段,取决于套餐与规则引擎可用变量。

开启 Verified Bots 会放行所有 AI 爬虫吗?

不会。Verified Bots 只是身份验证和分类基础,AI 机器人还可能被 AI Crawl Control、Block AI Bots、WAF 自定义规则或源站策略限制。AI Search、AI Assistant、Training 也应分开处理。

只写 robots.txt 允许 AI 爬虫够不够?

不够。robots.txt 是协议层偏好,Cloudflare WAF 和 Bot 规则是边缘访问控制。协议允许但 WAF 拦截时,爬虫仍可能拿到 403 或挑战页。

最小安全配置是什么?

先放行 cf.client.bot,再对低信誉自动化访问做 Managed Challenge,并单独审视 AI Search、AI Assistant、AI Crawler。上线后用 Security Events、源站日志和 AI 问答结果一起验证。