Cloudflare 按 URL 放行规则:只开放 llms.txt、核心页与文档页

Cloudflare 按 URL 放行规则:只开放 llms.txt、核心页与文档页

作者:maxaeo.cn|发布日期:2026-09-04|更新日期:2026-09-04

Cloudflare 按 URL 放行规则的核心不是“放开所有爬虫”,而是只让特定请求访问特定页面:例如 /llms.txt、产品核心页、文档页和报价页,同时继续保护后台、接口和登录路径。

Cloudflare 按 URL 放行规则示意图:只放行 llms.txt、核心页和文档页

什么是 Cloudflare 按 URL 放行规则?

Cloudflare 按 URL 放行规则是指用 http.request.uri.pathhttp.host、User-Agent、请求方法等条件,匹配指定 URL 后执行 Skip、Allow 或降低安全级别,而不是全站关闭 WAF。

在 AI 搜索和 GEO 场景里,这种做法尤其适合“临界放行”:让大模型爬虫能读到公开内容,但不扩大攻击面。Cloudflare 官方文档也说明,WAF 自定义规则可用 Skip 跳过特定安全功能,适用于合法流量被误拦的情况,详见 Cloudflare Skip action 文档

先确定哪些 URL 值得放行

只建议放行“可公开、可被引用、可解释品牌”的页面,不建议把全站、搜索页、参数页和后台路径一起放开。

一个 SaaS 官网可先放行 4 类 URL:

URL 类型 示例 放行理由 风险等级
AI 索引文件 /llms.txt/robots.txt 帮助爬虫发现核心内容
官网核心页 //product/pricing 承载品牌、产品、价格与定位 中低
文档页 /docs/*/help/* 常被 AI 引用作事实来源
关键博客页 /blog/核心主题/ 补充场景、教程和对比信息

MaxAEO 在 12 个 SaaS 与工具站的匿名排查中发现,最常见误区不是“没有白名单”,而是把 /blog/*/docs/* 全量放行,却没有排除预览页、站内搜索页和带参数的归档页。更稳的做法是先放行 10–30 个高价值 URL,再按日志扩展。

如果你的目标是让 AI 更快读懂官网结构,可先参考 llms.txt 目录索引设计,把最希望被引用的页面写清楚,再回到 Cloudflare 做最小放行。

推荐的最小放行表达式

最小放行表达式应同时限制主机、路径和请求方法;如果只按 User-Agent 放行,任何伪造 UA 的请求都可能进入例外范围。

适合官网主域的基础表达式:

(http.host eq "example.com" and http.request.method in {"GET" "HEAD"} and (
  http.request.uri.path eq "/llms.txt" or
  http.request.uri.path eq "/robots.txt" or
  http.request.uri.path eq "/" or
  http.request.uri.path in {"/product" "/pricing" "/about"} or
  http.request.uri.path wildcard "/docs/*"
))

如果还要叠加 AI 爬虫 UA,可写成:

(http.host eq "example.com" and http.request.method in {"GET" "HEAD"} and
 http.request.uri.path in {"/llms.txt" "/robots.txt" "/pricing"} and
 (
   http.user_agent contains "DeepSeek" or
   http.user_agent contains "Bytespider" or
   http.user_agent contains "Googlebot"
 ))

但要注意:UA 可伪造,所以它更适合作为“缩小范围”的条件,而不是唯一信任依据。Cloudflare 的 URL 标准化会影响后续依赖 URL 的功能,配置前应了解 Cloudflare URL normalization 文档

Skip、Allow 与降低安全级别怎么选?

放行公开内容时,优先用 Skip 跳过误拦的安全组件,而不是无条件 Allow;Allow 更像“通行证”,容易绕过后续规则。

常见选择如下:

动作 适合场景 不适合场景
Skip WAF Managed Rules 某些公开 URL 被托管规则误拦 登录、支付、管理后台
Skip Super Bot Fight Mode 已确认的合法自动访问 免费版 Bot Fight Mode 不可被 Skip
Allow 少量可信 IP 或内部服务 仅凭 UA 的爬虫放行
Managed Challenge 不确定是否恶意的流量 AI 爬虫抓取公开内容

Cloudflare 官方说明,Skip 可跳过 WAF Managed Rules、Rate Limiting、Super Bot Fight Mode 等部分功能,但不能跳过 Free 计划的 Bot Fight Mode。也就是说,如果你在免费计划开启 Bot Fight Mode 后发现 AI 爬虫仍被挑战,单靠 WAF Skip 规则可能无效。

更完整的误拦排查可参考 Cloudflare WAF 例外规则配置,先定位是哪一层规则在拦,再决定是否跳过。

只放行 llms.txt 时怎么配置?

只放行 llms.txt 的规则应限制为 GET/HEAD、精确路径和主域名,并开启日志观察,不要顺手放行整个根目录。

推荐表达式:

(http.host eq "example.com" and
 http.request.method in {"GET" "HEAD"} and
 http.request.uri.path eq "/llms.txt")

动作建议:

  1. 选择 Skip
  2. 只跳过导致误拦的 WAF Managed Rules 或 Bot 相关功能;
  3. 保留日志记录;
  4. 规则放在会拦截爬虫的规则之前;
  5. 发布后用日志确认状态码为 200、403 还是 Challenge。

如果文件本身不可访问,应先检查服务器、缓存和 robots,而不是直接加大白名单。可配合 llms.txt 文件检测清单 检查存在性、状态码和内容可读性。

Cloudflare 放行 llms.txt 的规则面板占位图

官网核心页与文档页如何分层放行?

核心页适合精确匹配,文档页适合前缀匹配;不要把后台、搜索、过滤参数页混在同一条放行规则里。

建议拆成 3 条规则:

规则 1:AI 索引文件

http.request.uri.path in {"/robots.txt" "/llms.txt" "/sitemap.xml"}

规则 2:核心转化页

http.request.uri.path in {"/" "/product" "/pricing" "/case-studies"}

规则 3:文档与帮助中心

http.request.uri.path wildcard "/docs/*" or http.request.uri.path wildcard "/help/*"

拆分的好处是便于回滚。若 /docs/* 出现异常请求,只需关闭文档规则,不影响 /llms.txt 和首页可访问性。若你需要按路径开放爬虫,可继续看 Cloudflare 按路径放行爬虫 的分层写法。

配置后如何验证是否真的被 AI 读到?

验证应分三层:Cloudflare 安全事件、源站访问日志、AI 回答引用结果。只看到 200 状态码,不代表 AI 已经采用该页面作为信源。

可按以下顺序复测:

  1. 在 Cloudflare Security Events 中筛选目标 URL;
  2. 查看是否命中 Skip 规则;
  3. 检查源站日志是否收到对应 GET/HEAD 请求;
  4. 对比请求前后 AI 回答里的品牌提及、排序和引用来源;
  5. 至少连续观察 7 天,避免把单日波动当成优化成功。

MaxAEO 国内版覆盖豆包、DeepSeek、腾讯元宝、通义千问、文心一言、Kimi 等 9 个中国大陆 AI 平台,可用于监测品牌提及率、排序、情绪评价与引用来源。若需要把 Cloudflare 放行结果和 AI 回答变化关联起来,可用 AI 引用来源分析 的方法做引用溯源。

常见错误:URL 放行越多,AI 可见性未必越好

URL 放行的目标是让高质量内容被稳定抓取,而不是让所有页面都能被访问。放行低价值页面,可能稀释 AI 对品牌事实的理解。

高频错误包括:

  • contains "/doc" 误放行无关路径;
  • 忘记限制 GETHEAD,导致表单或接口也被例外;
  • /admin/*/api/* 写进同一组白名单;
  • 只看 Cloudflare 命中记录,不看源站状态码;
  • 没有记录上线前基线,无法判断 GEO 优化是否有效。

在 AI 搜索里,正确路径通常是:先锁定品牌基线,再补足可引用页面,最后用同口径复测确认变化。MaxAEO 提供免费 AI 可见性诊断,输入官网域名约 60 秒即可生成首份包含提及率与核心结论的报告,适合用来判断放行前后的方向是否正确。

常见问题

Cloudflare 按 URL 放行规则会降低网站安全吗?

会降低被放行 URL 的部分防护强度,所以必须最小化范围。建议只放行公开内容页,并排除登录、后台、支付、上传和 API 路径。

只配置 robots.txt 允许抓取够不够?

不够。robots.txt 只是抓取声明,Cloudflare WAF、Bot 规则、源站防火墙仍可能拦截请求。AI 爬虫要真正访问页面,还需要网络链路返回可读状态。

是否应该按 User-Agent 放行所有 AI 爬虫?

不建议。User-Agent 可伪造,应与 URL、方法、主机、日志验证一起使用。对高价值页面可以放行,对敏感路径仍应保持挑战或阻断。

为什么放行后 AI 回答还没变化?

AI 回答更新受抓取频率、索引周期、引用信源质量和模型生成策略影响。建议至少观察 7–14 天,并用同一组问题复测提及率、排序和引用来源。

一条规则好,还是多条规则好?

多条规则更稳。把 /llms.txt、核心页、文档页分开管理,方便定位问题、单独回滚和评估哪类页面真正带来 AI 引用变化。