作者:maxaeo.cn|发布日期:2026-08-26|更新日期:2026-08-26
cloudflare 机器人管理设置的核心,是先区分“恶意自动化流量、已验证好机器人、业务 API、AI 爬虫”四类请求,再决定拦截、挑战、放行或限速。不要先套网上规则,否则很容易误伤 Googlebot、监控探针、支付回调或大模型抓取。

什么是 Cloudflare 机器人管理
Cloudflare 机器人管理指用 Cloudflare 的 Bot Fight Mode、Super Bot Fight Mode、Bot Management、WAF 自定义规则等能力,识别并处理自动化访问。它不是单一开关,而是一组按套餐和场景分层的安全配置。
按 Cloudflare 官方文档,Enterprise 版 Bot Management 可使用 cf.bot_management.score 这类字段做细粒度规则;Pro、Business 通常使用 Super Bot Fight Mode;免费站点更多依赖 Bot Fight Mode、WAF 和速率限制。Cloudflare 也在安全设置中提供 Block AI bots、Verified bots、Static resource protection 等选项,可参考 Cloudflare Bot custom rules 官方说明。
对站长来说,真正的问题不是“开不开”,而是:哪些机器人应该进站,哪些只能访问公开内容,哪些必须被拦。
推荐配置顺序:先基线,再开关,最后写规则
正确顺序是先看日志建立基线,再开启内置机器人防护,最后用 WAF 规则补足例外。这样能避免“安全开关生效了,但正常业务突然 403”的问题。
建议按 5 步执行:
- 记录当前 7 天访问基线:查看安全事件、源 IP、User-Agent、路径、状态码。
- 先确认业务白名单:支付回调、Webhook、监控、CI/CD、合作方 API。
- 开启基础机器人防护:Free 可用 Bot Fight Mode;Pro/Business 可配置 Super Bot Fight Mode。
- 按路径拆分策略:官网页面、登录页、后台、API、静态资源不要用同一动作。
- 上线后复测:检查 Google、Bing、AI 搜索抓取、站内 API、表单提交是否受影响。
Cloudflare 在 WAF 入门文档中也强调,Enterprise 用户应先在 Security Settings 里配置 Bot traffic,再考虑自定义规则;Bot score 仅适用于启用 Bot Management 的 Enterprise 场景,可参考 Cloudflare WAF get started 文档。
三类站点的推荐策略
不同网站不应使用同一套机器人设置。内容站重视搜索抓取,SaaS 官网重视线索表单与 AI 可见性,后台系统则应优先降低攻击面。
| 站点类型 | 主要风险 | 推荐动作 | 不建议做法 |
|---|---|---|---|
| 内容站 / 博客 | 采集、扫描、过高抓取频率 | 放行 Verified Bots,限制异常 UA 与高频访问 | 全站 JS Challenge |
| SaaS 官网 | 表单刷量、AI 爬虫误拦、竞品采集 | 前台放宽、登录和 API 收紧 | 把 /api 与官网页面同规则处理 |
| 管理后台 | 爆破、扫描、撞库 | 地区/IP/身份校验 + 高强度 WAF | 只靠 Bot Fight Mode |
| 电商站 | 库存爬取、价格抓取、黄牛脚本 | 商品页限速,结账页强校验 | 对搜索引擎爬虫一刀切 |
一个简单判断:公开获客页面要“可被发现”,交易和管理路径要“可被验证”。 如果你在做 GEO/AEO,还要额外关注 AI 搜索引擎能否读取品牌介绍、产品页、文档页和对比页。相关排查可结合 AI 爬虫访问被拦截的最小放行方法。
Bot Fight Mode、Super Bot Fight Mode 与 Bot Management 怎么选
三者差异主要在可配置粒度。Bot Fight Mode 更像基础自动化拦截,Super Bot Fight Mode 增加分类动作,Enterprise Bot Management 才能用机器人分数做精细规则。
| 能力 | 适合对象 | 典型设置 |
|---|---|---|
| Bot Fight Mode | 免费站、小型站点 | 开启后观察误伤,不适合复杂 API |
| Super Bot Fight Mode | Pro / Business 站点 | 对 Definitely automated、Likely automated、Verified bots 分别设置 |
| Bot Management | Enterprise、复杂业务 | 使用 bot score、verified bot、路径与请求特征组合规则 |
如果你的站点有大量 API、App 请求、监控探针或爬虫合作方,单靠开关往往不够。更稳妥的做法是:先让已验证好机器人通过,再对低分机器人按路径拦截或挑战。
Cloudflare 官方示例中,Enterprise Bot Management 常见表达式是按分数处理,例如对 cf.bot_management.score lt 30 且非 verified bot 的请求执行拦截或挑战;API 路径则需要额外排除,避免误伤自动化业务请求。
一套可落地的 WAF 规则框架
实操中,规则顺序比规则数量更重要。先放行业务必需流量,再拦截高风险路径,最后对低置信度机器人做挑战。
推荐从这 4 层开始:
第 1 层:放行可信业务请求
可信请求包括支付回调、监控服务、内部接口、合作方回调和必要搜索引擎机器人。可以用 IP、Header、路径、mTLS 或 Cloudflare Access 组合验证。
不要只用 User-Agent 放行关键接口,因为 UA 很容易伪造。对支付和订单类回调,优先使用来源 IP 段、签名 Header 或双方约定密钥。
第 2 层:保护后台和登录路径
登录页、后台、管理 API 应单独加固。常见策略包括 Turnstile、速率限制、地区限制、IP allowlist、失败次数控制。
例如 /wp-login.php、/admin、/login、/api/auth 不应和首页、博客页共享同一机器人动作。攻击者最常打的不是你的文章页,而是登录入口和遗留敏感路径。
第 3 层:限制明显异常请求
对空 UA、扫描器 UA、访问 .env、.git、/wp-config.php、/phpmyadmin 等路径的请求,可直接阻断。
这类访问通常不带来真实用户价值,误伤概率也低。
但要避免复制超长 UA 黑名单。黑名单越长,维护成本越高,也越容易误杀开发工具、合法探针或 AI 抓取服务。
第 4 层:对不确定流量使用挑战或限速
对“可能是机器人但不确定”的流量,优先用 Managed Challenge 或 Rate Limiting,而不是直接 Block。
这尤其适用于商品列表页、搜索页、下载页和文档页。
Cloudflare 的 Challenge bad bots 示例 给出的思路是:对低 bot score 且非 verified bot 的流量进行处理,同时为 API 路径保留例外。
AI 爬虫应该拦还是放
AI 爬虫不应一概放行或一概拦截。用于训练、批量抓取、实时回答引用的爬虫价值不同,应按品牌目标拆开处理。
如果你希望品牌信息进入 AI 搜索结果,官网、产品页、文档页、价格页、对比页最好保持可抓取。若你更关心内容版权和服务器成本,可以对训练型爬虫更严格,对能带来引用和访问的检索型爬虫更开放。
一个可执行的分层策略是:
- 官网核心页面:允许主流搜索引擎与目标 AI 检索访问。
- 价格、文档、案例页:允许读取,但观察频率与来源。
- 后台、账户、订单、下载接口:不因 AI 爬虫身份而放宽。
- 大规模训练型抓取:结合 robots.txt、Cloudflare Block AI bots、速率限制处理。
如果你正在处理 DeepSeek、豆包、Kimi 等 AI 平台的抓取与引用问题,可参考 国产 AI 爬虫 UA 识别与 WAF 白名单配置 和 DeepSeek 爬虫抓取协议配置指南。

原创复测框架:用“4×3 表”判断是否误拦
只看 Cloudflare 安全事件不够,因为“没报错”不代表 AI 或搜索引擎能正常读取页面。更可靠的方法是用 4 类流量、3 个结果指标做复测。
| 流量类型 | 测试对象 | 通过标准 |
|---|---|---|
| 搜索引擎 | Googlebot、Bingbot | 核心页面返回 200,未被 Challenge |
| AI 抓取 | 目标 AI 爬虫或模拟 UA | 公开页面可访问,敏感路径不可访问 |
| 业务自动化 | Webhook、监控、API 客户端 | 不出现 403、429、Challenge |
| 恶意模拟 | 空 UA、扫描路径、高频请求 | 被阻断、挑战或限速 |
实践中,建议每次改规则后抽样 20 个 URL:10 个公开页面、5 个业务接口、3 个后台路径、2 个静态资源。记录状态码、Cloudflare Ray ID、触发规则、响应时间。
这套方法的价值在于把“感觉安全”变成“可复测的安全”。
MaxAEO 在 AI 搜索可见性监测中也使用类似的基线思路:先记录品牌在多个 AI 平台中的提及、排序、情绪和引用来源,再观察优化后的变化。若担心 Cloudflare 影响 AI 引用,可用 MaxAEO 免费 AI 可见性诊断 先看品牌是否能被主流 AI 正常提及。
常见错误:这些设置最容易导致 403
Cloudflare 机器人配置最常见的坑,是把“自动化请求”等同于“坏请求”。实际业务里,很多好流量也是自动化的。
常见错误包括:
- 对全站开启强挑战,导致 AI、搜索引擎、监控探针读不到页面。
- 开启 Block AI bots 后,又希望大模型实时引用官网内容。
- 忘记为
/api、Webhook、健康检查路径添加例外。 - 只看 User-Agent,不校验 IP、签名或来源。
- 把静态资源保护开得过严,导致页面渲染、截图服务、监控服务异常。
- 复制别人的 WAF 表达式,却没有按自己的路径结构调整。
如果已经出现误伤,先不要急着关闭所有安全功能。更合理的顺序是:查 Security Events,定位触发的 ruleset 和 action;找到对应路径;把业务必需流量做最小放行;再复测是否恢复。关于误伤定位,可结合 WAF 误伤机器人流量的排查框架。
上线前检查清单
最终配置应满足两个目标:恶意流量进不来,重要机器流量不被误伤。上线前至少检查以下项目。
- Verified Bots 是否允许或至少不被自定义规则误拦。
- 登录页、后台、管理 API 是否比公开页面更严格。
/api、Webhook、监控探针是否有独立规则。- 是否明确决定 Block AI bots 的开启条件。
- robots.txt、llms.txt、WAF、源站规则是否互相冲突。
- 是否保留 7 天以上安全事件用于回滚分析。
- 是否记录每条规则的目的、负责人和复测日期。
- 是否用同一批 URL 做上线前后对比测试。

常见问题
Cloudflare 机器人管理会影响 SEO 吗?
会,尤其是全站 Challenge、误拦 Verified Bots、阻断搜索引擎资源抓取时。建议先检查 Googlebot、Bingbot 是否能访问核心 HTML、CSS、JS 和图片资源,再逐步加强敏感路径规则。
开启 Block AI bots 后还能被 AI 搜索引用吗?
可能会受影响。Block AI bots 的目的就是阻止一批 AI 爬虫访问。若品牌希望被 AI 搜索理解和引用,应区分训练型抓取、实时检索抓取和业务敏感路径,而不是全站统一拦截。
免费版能不能做精细机器人规则?
免费版可以使用部分 WAF、自定义规则和 Bot Fight Mode,但不能使用 Enterprise Bot Management 的 bot score 字段。若需要按机器人分数、路径、请求属性精细处置,通常需要更高阶方案。
机器人白名单只写 User-Agent 可以吗?
不建议。User-Agent 可伪造,适合辅助识别,不适合单独作为高信任放行依据。关键接口应结合 IP、Header 签名、访问路径、频率和身份验证。
改完规则后多久复测?
建议立即测一轮核心路径,24 小时后再看日志趋势,7 天后评估误伤和拦截效果。若网站依赖 AI 搜索曝光,还应观察 AI 平台回答中的提及率、引用来源和描述是否变化。
