Cloudflare 仅允许爬虫访问指定页面配置指南

Cloudflare 仅允许爬虫访问指定页面配置指南

作者:maxaeo.cn|发布日期:2026-09-06|更新日期:2026-09-06

Cloudflare 仅允许爬虫访问指定页面,适合既怕被恶意抓取、又希望 AI 搜索能读到品牌核心信息的网站。正确做法不是关闭 WAF,也不是全站放行 AI Bot,而是只开放品牌页、产品页、文档页、报价页、/llms.txt 与少量可引用页面。

Cloudflare 仅允许爬虫访问指定页面的路径放行架构图

什么是“只允许爬虫访问指定页面”?

只允许爬虫访问指定页面,是指用 Cloudflare WAF、自定义规则、机器人规则和 robots.txt 共同控制:爬虫只能访问被明确授权的 URL,其余后台、接口、搜索页、参数页继续拦截或挑战。

这是一种最小权限策略。对 GEO/AEO 来说,它的价值在于:让 AI 引擎更容易抓到“能代表品牌事实”的页面,同时减少无意义抓取、训练型爬虫滥用、登录接口暴露和参数页污染。

Cloudflare 官方 WAF 文档说明,自定义规则可以基于请求属性过滤流量,包括 URL 路径、Header、方法等条件;Google 的 robots.txt 规范文档 也明确支持 user-agentallowdisallow 等规则。但要注意:robots.txt 是抓取指引,不等于安全边界;真正的访问控制仍应放在 Cloudflare 规则层。

哪些页面值得放行,哪些页面必须继续保护?

值得放行的是“公开、稳定、可被引用、能解释品牌”的页面;不应放行的是登录、后台、支付、站内搜索、参数筛选、用户数据和 API 接口。判断标准不是页面重要不重要,而是它是否适合被 AI 读取和复述。

可用下面这张 12 类路径矩阵做初筛:

路径类型 示例 建议动作 原因
AI 索引文件 /llms.txt/robots.txt 放行 帮助爬虫发现核心页面
品牌介绍页 /about/brand 放行 提供实体事实
产品页 /product/features 放行 解释能力与场景
价格页 /pricing 谨慎放行 需保持信息更新
文档页 /docs/ 放行 易被 AI 引用
案例页 /case/ 放行公开版 有助于可信度
博客核心文章 /blog/核心主题 选择性放行 承接长尾问题
站内搜索 /search 不放行 易产生低质页面
参数页 ?sort=?filter= 不放行 易造成重复抓取
登录注册 /login/admin 拦截或挑战 高风险
API /api/ 拦截或限速 不适合公开抓取
文件上传 /upload 拦截 安全风险高

MaxAEO 在做品牌 AI 可见性诊断时,也会把“AI 是否读到了正确页面”作为检查项之一。若官网核心页没有被 AI 引用,建议先看路径是否被 robots、WAF、CDN 或重定向拦住,再谈内容优化。

Cloudflare 规则应该怎么写?

核心规则是:先识别爬虫,再限制路径,最后决定动作。Cloudflare 仅允许爬虫访问指定页面时,表达式通常由 User-Agenthttp.request.uri.pathhttp.host、请求方法和机器人验证字段组成。

一个常见思路是“允许可信爬虫访问白名单路径,其他路径继续走默认防护”。Cloudflare 官方的 AI Crawl Control with WAF 文档 也提到,可通过基于路径的例外,让被阻止的爬虫访问站点中特定部分。

示例表达式可按你的站点调整:

(
  http.request.uri.path in {
    "/llms.txt"
    "/robots.txt"
    "/about"
    "/pricing"
  }
  or starts_with(http.request.uri.path, "/docs/")
  or starts_with(http.request.uri.path, "/product/")
)
and
(
  http.user_agent contains "Googlebot"
  or http.user_agent contains "bingbot"
  or http.user_agent contains "Perplexity"
  or http.user_agent contains "Claude"
  or http.user_agent contains "GPTBot"
)
and http.request.method in {"GET" "HEAD"}

动作不要一上来就选“全跳过”。更稳妥的顺序是:

  1. 对白名单路径执行 Skip 指定 WAF 规则或降低安全级别;
  2. 保留速率限制、DDoS 防护和日志记录;
  3. /login/admin/api/ 明确 Block 或 Managed Challenge;
  4. 观察 3–7 天日志后再扩大路径范围。

如果你需要更细的路径方案,可参考站内的 Cloudflare 按 URL 放行规则:只开放 llms.txt、核心页与文档页,里面更适合用于落地前的路径清单整理。

robots.txt 与 WAF 应该怎么配合?

robots.txt 负责“告诉合规爬虫哪里能抓”,WAF 负责“强制决定请求能不能进来”。只写 robots.txt 不能阻止不守规矩的爬虫;只写 WAF 又可能让合规爬虫不知道哪些页面最重要。

推荐组合如下:

User-agent: *
Disallow: /admin/
Disallow: /login/
Disallow: /api/
Disallow: /search
Allow: /llms.txt
Allow: /docs/
Allow: /product/
Allow: /pricing
Allow: /about

然后在 Cloudflare 侧做同口径规则:允许 GET/HEAD 请求访问这些路径,拒绝或挑战高风险路径。这样做的好处是,robots.txt 给合规爬虫明确路径,WAF 给站点提供实际安全边界。

如果你的目标是让 AI 更快读懂站点,还应设计清晰的 llms.txt。可参考 llms.txt 目录索引设计:让 AI 快速读懂官网核心页面,把品牌介绍、产品能力、文档入口、价格说明和关键问答集中索引。

Cloudflare 爬虫访问控制与 robots.txt、llms.txt 的协同关系

面向 AI 爬虫时,最容易犯的 5 个错误

AI 爬虫放行最常见的问题不是“没放行”,而是放行边界过大、验证不足或页面质量太低。Cloudflare 仅允许爬虫访问指定页面时,要避免把安全问题包装成 GEO 优化问题。

常见错误包括:

  1. 全站白名单:为了让 AI 抓取,直接跳过所有 WAF。短期省事,长期风险最高。
  2. 只看 User-Agent:UA 可伪造,应结合 Cloudflare Verified Bots、IP、日志、行为和路径判断。
  3. 放行参数页:筛选、排序、搜索结果页会制造大量重复 URL。
  4. 忽略重定向链:爬虫访问 /pricing,却被重定向到带地区参数或前端空壳页,AI 可能读不到正文。
  5. 没有复测引用:日志里出现抓取,不代表 AI 答案会引用;还要看后续回答是否提及、排序是否变化、来源是否来自官网。

站内的 AI 机器人 UA 白名单配置指南 可作为 UA 识别的补充,但真正上线时仍应以日志和引用复核为准。

原创框架:用“3×4 页面准入表”决定是否放行

一个页面是否应该放给爬虫,可以用“3 个价值维度 × 4 个风险等级”评分。这个框架适合市场、SEO、运维和安全团队一起评审,避免只从单一部门视角做决定。

3 个价值维度:

  • 品牌价值:是否能准确解释品牌、产品、定位、资质?
  • 引用价值:是否适合被 AI 摘要、引用、推荐?
  • 更新价值:内容是否稳定,是否有人维护?

4 个风险等级:

  • R0:完全公开,如 /llms.txt、公开文档;
  • R1:公开但需更新,如价格页、产品页;
  • R2:半公开或可能过期,如旧活动页、旧案例页;
  • R3:敏感或动态,如后台、接口、订单、搜索页。

建议只放行“品牌价值 ≥2、引用价值 ≥2、风险等级 ≤R1”的页面。R2 页面先更新再放行,R3 页面不应为了 AI 抓取而开放。

这个框架的独特价值在于,它把 GEO/AEO 的“可见性需求”和安全团队的“攻击面控制”放到同一张表里讨论。对 SaaS 官网尤其有效,因为 SaaS 网站常见的报价页、文档页、帮助中心和 API 文档风险等级并不相同,不能用一条规则全部处理。

验证流程:怎么确认真的只放行了指定页面?

验证要同时看三类结果:Cloudflare 日志是否命中、页面是否返回 200、AI 平台是否逐步引用。只看到访问日志,不能证明 GEO 生效;只看到 AI 提及,也不能证明规则安全。

建议按以下步骤复测:

  1. 路径测试:用同一 UA 请求 /llms.txt、产品页、文档页,应返回 200。
  2. 反向测试:请求 /login/admin/api/,应被拦截、挑战或限速。
  3. 日志核对:在 Cloudflare Security Events 中确认规则命中路径与动作。
  4. 源站核对:检查 Nginx、应用日志或托管平台日志,确认请求确实到达目标页面。
  5. 引用监测:观察 AI 回答中是否出现官网页面、产品描述和正确品牌事实。

MaxAEO 提供 AI 搜索可见性诊断,可检测品牌在 ChatGPT、Gemini、Perplexity、Claude 等 AI 平台的提及率、排名与情感;国内版 maxaeo.cn 覆盖 Kimi、DeepSeek、腾讯元宝、豆包、通义千问、文心一言等 9 个中国大陆 AI 平台。品牌可以用诊断报告判断:放行核心页后,AI 提及率、推荐位次和引用来源是否出现变化。

若你正在排查国产模型抓取问题,可结合 国产 AI 爬虫放行规则:robots、UA、WAF 与 CDN 配置清单 做分层检查。

只放行指定页面后的日志验证与 AI 引用复测流程

一套更稳的上线顺序

上线顺序应从“最小页面集合”开始,而不是一次性覆盖全站。先开放 5–20 个高价值 URL,确认无异常后,再逐步增加文档、案例和核心博客页。

推荐顺序如下:

  1. 第 1 天:开放 /robots.txt/llms.txt、品牌页、产品页;
  2. 第 2–3 天:加入文档首页、核心功能页、价格页;
  3. 第 4–7 天:观察 Cloudflare 日志、源站负载和异常请求;
  4. 第 8 天后:加入高质量案例页和少量核心文章;
  5. 每周:复查 AI 答案是否引用正确来源,删除低质或过期页面。

这样做比“先全放开再回收”更安全。它也更适合 SaaS 采购场景,因为 AI 回答常围绕“某类工具推荐、功能对比、价格、适用团队、替代方案”展开,真正需要被抓取的是少数能回答购买问题的页面。

常见问题

Cloudflare 仅允许爬虫访问指定页面,会影响普通用户访问吗?

不会,前提是规则条件只匹配爬虫身份和指定路径。普通用户访问应继续走原有缓存、WAF 和安全策略,不应被放行规则覆盖。

只靠 robots.txt 能实现指定页面放行吗?

不能完全实现。robots.txt 是合规爬虫的抓取指引,不是强制访问控制。安全边界应放在 Cloudflare WAF、自定义规则、速率限制和源站权限上。

AI 爬虫应该全放行吗?

不建议。更稳的做法是放行品牌页、产品页、文档页、报价页、llms.txt 等高价值页面,继续保护后台、接口、搜索页和参数页。

放行后多久能在 AI 答案里看到变化?

没有固定时间。抓取、索引、引用和答案生成是不同环节。建议按天记录 Cloudflare 命中、源站访问、AI 提及率、推荐位次和引用来源,而不是只看一次问答结果。

MaxAEO 能帮忙判断哪些页面该放行吗?

可以。MaxAEO 提供免费的 AI 可见性诊断,支持分析品牌在多个 AI 平台中的提及率、排名、情感和引用来源,并可帮助识别官网核心页面是否被 AI 正确读取。可从 MaxAEO 官网 获取诊断入口。

结论:安全放行的关键是“页面准入”,不是“爬虫全信任”

Cloudflare 仅允许爬虫访问指定页面,本质是把 AI 抓取从“全站开放”改成“高价值页面准入”。对品牌官网而言,最优策略通常是:robots.txt 给出抓取指引,Cloudflare WAF 执行路径边界,llms.txt 提供核心索引,再用 AI 可见性监测验证提及率、推荐位次和引用来源是否改善。

这套方法不会承诺某个 AI 一定推荐你,但能让品牌在安全可控的前提下,把最该被读取的页面交给爬虫,把不该暴露的区域继续锁住。