作者:maxaeo.cn|发布日期:2026-09-01|更新日期:2026-09-01
Cloudflare 按路径放行爬虫,核心不是把所有机器人加入白名单,而是只允许可信爬虫访问必要路径:/robots.txt、/llms.txt、站点地图和公开内容页。这样既能让搜索引擎与 AI 搜索读取品牌信息,又能继续保护登录页、接口、结算页和后台。

什么是 Cloudflare 按路径放行爬虫?
Cloudflare 按路径放行爬虫,是用 WAF 自定义规则、Bot 管理或 AI Crawl Control,按 URL 路径给可信爬虫设置例外,而不是按全站放行。适合既重视抓取可见性,又不想降低站点安全基线的网站。
它解决的是一个常见冲突:robots.txt 写了允许,但 Cloudflare 边缘层、Bot Fight Mode、Managed Rules 或自定义拦截规则先把请求挡掉。Cloudflare 官方说明,robots.txt 只是表达抓取偏好,并不能在技术层强制执行;若要真正控制访问,需要结合边缘规则与 AI Crawl Control(见 Cloudflare managed robots.txt 文档)。
哪些路径应该优先放行?
优先放行四类低风险、高价值路径:抓取规则文件、模型提示文件、站点地图和公开内容页。不要把 /api/、/admin/、/login、购物车、支付、用户中心一起放进例外。
| 路径类型 | 建议动作 | 原因 |
|---|---|---|
/robots.txt |
放行 | 搜索爬虫与合规 AI 爬虫会先读取抓取规则 |
/llms.txt |
放行 | 方便 AI 系统理解站点说明、重点页面与引用入口 |
/sitemap.xml、/sitemap_index.xml |
放行 | 提供可索引 URL 清单 |
/blog/、/docs/、/products/ |
条件放行 | 承载品牌、产品、知识库与对比内容 |
/api/、/wp-admin/、/checkout/ |
不放行 | 风险高,通常不需要被爬虫访问 |
如果正在建设 AI 搜索可见性,可先阅读 Cloudflare 机器人白名单配置指南,再把全局白名单改成路径级例外。
推荐的 WAF 规则怎么写?
最稳妥的规则是“可信身份 + 指定路径 + Skip 必要防护”。Cloudflare 的 WAF 自定义规则支持 Skip 动作,用于跳过部分安全功能;字段文档也列出了 http.request.uri.path、cf.client.bot、cf.verified_bot_category 等可用字段(见 Cloudflare Skip 规则文档 与 字段参考)。
示例一:只放行 Cloudflare 已验证的好机器人访问规则文件与站点地图。
(cf.client.bot and (
http.request.uri.path eq "/robots.txt" or
http.request.uri.path eq "/llms.txt" or
http.request.uri.path eq "/sitemap.xml" or
http.request.uri.path eq "/sitemap_index.xml"
))
动作建议选择:Skip,只跳过会误伤抓取的 Bot Fight Mode、Super Bot Fight Mode 或相关 Managed Rules;不要无差别跳过全部安全产品。
示例二:放行已验证爬虫访问公开内容目录。
(cf.client.bot and (
starts_with(http.request.uri.path, "/blog/") or
starts_with(http.request.uri.path, "/docs/") or
starts_with(http.request.uri.path, "/products/")
))
如果站点没有企业版 Bot Management,不要轻易用“UA 包含 bot/spider 就放行”。User-Agent 可以伪造,路径级规则仍应配合速率限制、日志复核和来源验证。关于请求头排查,可参考 大模型爬虫请求头识别方法。
AI 爬虫要不要和搜索爬虫分开?
要分开。搜索爬虫、AI 搜索抓取、训练爬虫和实时用户代理不是一类流量;同一条规则全放行,容易把训练抓取、采集器和搜索索引混在一起。
Cloudflare 目前把 AI 相关访问按用途区分,例如 Search、Agent、Training 等类别;其文档还提示 2026 年 9 月 15 日起,新域名默认策略会发生变化,广告页面上的 Training 与 Agent 类机器人将被阻止,而 Search 类保持允许(见 Cloudflare Block AI Bots 文档)。这意味着站长不能只看 robots.txt,还要检查 Cloudflare 层的 AI 策略是否与抓取目标一致。
对品牌站、SaaS 官网和内容站,常见策略是:
- 允许搜索型爬虫访问公开内容页。
- 允许答案型或检索型 AI 爬虫访问知识库、案例、定价说明等可公开页面。
- 限制训练型爬虫,特别是大规模抓取、低转化、无引用回报的访问。
- 拦截未知高频爬虫,尤其是访问参数页、登录页、搜索结果页的异常请求。
一手排查样本:误拦通常发生在哪一层?
2026 年 8 月,MaxAEO 内容技术团队抽样检查了 7 个使用 Cloudflare 的 SaaS 官网,方法是对同一批公开 URL 分别发起普通浏览器请求、已知爬虫 UA 请求、/robots.txt 请求和内容页请求,并核对 Cloudflare 安全事件与源站日志。样本不代表全网,但能说明排查优先级。
结果显示,7 个站点中有 5 个出现过“规则文件可访问、内容页对爬虫 403”或“源站无记录、Cloudflare 边缘层已拦截”的情况。误拦来源主要有三类:Bot Fight Mode 对自动化请求挑战、旧 WAF 规则按 UA 关键词拦截、全站国家/地区规则没有给验证爬虫留例外。
这组样本给出的结论是:先查边缘层,再查源站;先按路径缩小放行,再谈全站白名单。 如果你的目标是让 AI 搜索正确读取品牌信息,还应在放行后观察提及率、推荐位次和引用来源变化。MaxAEO 可监测品牌在豆包、DeepSeek、腾讯元宝、通义千问、文心一言等 9 个国产 AI 平台中的提及率、排序、情绪评价与引用来源,并支持每天复测趋势。
配置步骤:从规则文件到内容页逐层放行
按路径放行应按“先小后大”执行:先保证规则文件能访问,再开放站点地图,最后只给高价值内容目录设置爬虫例外。每一步都要用日志验证,不要一次性改全站。

-
列出必须开放的 URL
至少包括/robots.txt、/llms.txt、/sitemap.xml,以及你希望被搜索或 AI 引用的内容目录。 -
检查现有 robots.txt
确认没有误写Disallow: /,也没有把/blog/、/docs/等内容目录排除。Google 说明,robots.txt用于告知搜索爬虫哪些 URL 可访问,但不是隐藏网页或强制安全控制工具(见 Google Search Central 的 robots.txt 指南)。 -
新建 WAF Skip 规则
匹配cf.client.bot与必要路径,只跳过会拦截爬虫的安全模块。若使用 AI Crawl Control,还要确认 Search、Agent、Training 的策略与业务目标一致。 -
保留敏感路径拦截
对/api/、/login、/admin/、/checkout/继续启用挑战、限速或阻断。不要为了 AI 抓取牺牲后台安全。 -
用日志复测
查看 Cloudflare Security Events、源站访问日志、状态码、Ray ID、User-Agent、路径和命中规则。若要验证 DeepSeekBot,可参考 DeepSeek 爬虫验证方法。
如何判断放行是否真的生效?
判断生效不能只看浏览器访问成功,而要同时看状态码、源站命中、爬虫身份和后续引用变化。最少保留 7 天日志,避免把单次 200 当成长期成功。
建议记录这 6 个字段:
- 请求时间;
- URL 路径;
- HTTP 状态码;
- User-Agent;
- Cloudflare 命中规则或安全事件;
- 源站是否收到请求。
技术层通过后,再观察业务层指标:品牌是否被 AI 回答提及、是否进入推荐列表、引用来源是否出现自有域名。MaxAEO 支持保留 AI 原始回答、按平台和时间追踪提及率趋势,并可将已有 SEO 关键词导入为 AI 搜索监测 Prompt,用于验证改动上线后的真实影响。
常见问题
只放行 /robots.txt 就够了吗?
不够。/robots.txt 只能告诉爬虫哪些路径允许访问;如果内容页仍被 Cloudflare WAF 或 Bot 规则拦截,爬虫读到规则后仍无法抓取正文。
可以按 User-Agent 直接放行 AI 爬虫吗?
不建议单独依赖 User-Agent。UA 容易伪造,更稳妥的做法是使用 Cloudflare 已验证机器人字段、AI Crawl Control 分类、路径限制和速率限制组合判断。
/llms.txt 一定要放行吗?
如果站点希望被 AI 搜索更准确理解,建议放行。/llms.txt 可作为 AI 读取站点结构、核心页面和品牌说明的入口,但它不能替代高质量内容页。
放行爬虫会不会降低网站安全?
按路径、按身份、按用途放行,风险可控;全站跳过 WAF 才危险。敏感路径应继续启用挑战、阻断、速率限制和访问控制。
配置后多久能看到 AI 搜索变化?
技术访问通常当天可在日志中看到;AI 回答里的提及、排序和引用变化取决于各平台抓取与更新节奏。建议至少按 7–14 天观察趋势,而不是用单日结果判断成败。
