CDN拦截AI爬虫,指页面本身可访问、robots.txt 也允许,但请求在 CDN、WAF、Bot 管理或速率限制层被返回 403、429、验证码或空白页。它的典型结果是:搜索引擎还能收录你,AI 搜索却读不到、引用不到、推荐不到。
这类问题难排,是因为它不一定出现在源站日志里。AI 爬虫还没到你的服务器,就可能已在边缘节点被拦下。

什么情况下应怀疑是 CDN 或 WAF 误拦截?
答案很简单:同一个 URL 对普通浏览器和传统搜索爬虫正常,对 AI 爬虫返回 403、429、挑战页或超短响应体,就应优先查 CDN/WAF,而不是先改内容。
常见信号有 5 个:
- 百度、Google Search Console 抓取正常,但 ChatGPT、Perplexity、Claude 等答案长期不引用该站。
- robots.txt 明确 Allow,AI 爬虫仍拿到 403。
- 源站 access log 没有对应请求,CDN 安全事件却有命中记录。
- 响应头出现
cf-mitigated、server: cloudflare、x-cache、captcha等边缘层特征。 - 同一 URL 用普通 UA 返回 200,换成 AI crawler UA 后返回 403。
如果你遇到“网站能被百度和谷歌抓取,却被 AI 爬虫返回 403”,可结合这份CDN 与 WAF 误拦截排查清单做更细的分层定位。
为什么 robots.txt 放行了,AI 爬虫仍会被挡?
**robots.txt 是协议声明,不是网络通行证。**AI 爬虫访问页面前,仍要经过 DNS、TLS、CDN、WAF、Bot 分数、频控、地区规则和源站鉴权。任一层拒绝,请求都到不了 robots.txt 之后的内容。
这也是很多 AEO 项目误判的根源:运营只检查了 robots.txt,技术只看了源站日志,两边都认为“没问题”。
但 CDN 的 Bot 管理规则通常在边缘执行。以 Cloudflare 为例,其官方文档已提供按 AI 爬虫类别管理、阻断或放行的能力,并将 AI 流量区分为 Search、Agent、Training 等用途;Cloudflare 文档还说明 2026 年 9 月 15 日起,新域名的部分默认策略会调整为允许 Search、在含广告页面阻断 Training 和 Agent 类型流量,详见 Cloudflare Block AI Bots 文档。
先别“一刀切”:AI 爬虫应按用途分三类
**不是所有 AI 爬虫都该同等放行,也不是所有都该封。**AEO 视角下,应把它们分成搜索引用、用户实时访问、模型训练三类,再分别配置策略。
| 类型 | 代表场景 | 建议策略 | 风险 |
|---|---|---|---|
| AI 搜索爬虫 | 用于发现、索引、回答时引用公开网页 | 优先放行核心页面 | 被误拦会损失 AI 可见性 |
| 用户代理/实时抓取 | 用户在 AI 工具里请求打开某网页 | 视业务价值放行或限速 | 可能带来突发访问 |
| 训练爬虫 | 用于模型训练或数据集构建 | 按内容资产价值决定 | 放行可能增加内容被批量抓取 |
OpenAI 官方帮助文档也把广告、搜索等爬虫做了区分,并建议广告主检查 403、429、CDN/WAF 日志和机器人拦截事件,可参考 OpenAI 网络爬虫放行指南。Google 则提供 Google-Extended 作为 robots.txt 产品令牌,用于管理内容是否可被用于 Gemini 相关用途,见 Google 爬虫官方文档。
一手小样本:32 个品牌站的误拦截高发点
maxaeo.cn 在 2026 年 6–8 月复盘了 32 个中文品牌站的 AI 可达性诊断记录,样本覆盖 B2B SaaS、教育、消费品、连锁服务和汽车后市场。测试方法是:选取首页、品牌介绍页、3 个核心落地页、5 篇知识内容页,用普通浏览器 UA、搜索引擎 UA、常见 AI 爬虫 UA 分别请求,记录状态码、响应体长度、CDN 安全事件和源站日志是否命中。
结果显示:
- 32 个站中,11 个存在 AI 爬虫 403 或挑战页问题;
- 其中 7 个 robots.txt 配置看起来允许抓取;
- 9 个问题发生在 CDN/WAF 层,源站日志没有请求记录;
- 最常见触发项是 Bot 分数过低、AI crawler 分类阻断、海外地区限制、统一 UA 黑名单;
- 只有 3 个站在修复前能提供“AI 爬虫成功访问核心落地页”的证据链。
这个样本不代表全网比例,但能说明一个事实:AI 可见性故障经常不是内容问题,而是可达性问题。
如何排查 CDN拦截AI爬虫?按 6 步定位
**排查顺序应从“请求是否到达”开始,而不是从“内容是否优质”开始。**下面这 6 步能把问题从 CDN、WAF、robots、渲染和源站中拆开。
-
固定测试 URL
选择首页、品牌页、产品页、价格页、3–5 篇内容页。不要只测首页,因为很多误拦截只发生在/blog/、/docs/或带参数页面。 -
对比不同 User-Agent
用普通浏览器、Googlebot、OAI-SearchBot、GPTBot、ClaudeBot、PerplexityBot 等 UA 分别请求。不要只看状态码,还要看响应体长度和是否返回挑战页。 -
查 CDN 安全事件
在 CDN 控制台按时间、IP、路径、UA 筛选。重点看是否命中 Bot 管理、WAF 自定义规则、速率限制、国家/地区封禁、JS Challenge。 -
查源站日志是否有记录
如果 CDN 有拦截事件、源站无记录,说明请求被挡在边缘。此时改 Nginx、应用路由或 CMS 通常无效。 -
检查 robots.txt 与 CDN 托管 robots 是否一致
有些 CDN 会托管、改写或追加 robots 规则。需要从公网请求最终版本,而不是只看代码仓库里的文件。 -
做修复后复测
放行后用同一批 URL、同一批 UA、同一时间窗口复测。记录 200、301、403、429 的变化,形成可复现证据。
如果排查范围扩展到 DNS、证书、渲染和 iframe,可参考端到端 AI 爬虫可达性排查方法。
推荐配置:放行“AI 搜索”,限制“训练抓取”
对多数希望获得 AI 推荐和引用的品牌站,最稳妥策略是:核心公开页面允许 AI 搜索类爬虫访问,对训练类爬虫按目录限制或限速。
一个可执行的策略如下:
- 首页、品牌页、产品页、案例页、FAQ、帮助文档:允许 AI 搜索类爬虫。
- 后台、购物车、搜索结果页、站内筛选页:全部禁止或 noindex。
- 原创数据库、付费报告、会员内容:不建议无条件放行训练爬虫。
- 高频访问的 AI bot:先限速,再评估是否封禁。
- 混合用途爬虫:优先使用官方可识别令牌和 CDN verified bot 分类,不建议只凭 UA 字符串粗暴判断。

如果团队正在写 robots,可结合国产 AI 爬虫 robots 放行、限速与分目录取舍一起制定规则;如果准备增加 llms.txt,还需要验证它是否真的被读取,可参考llms.txt 文件规范与验证方法。
CDN 放行规则不要只写 User-Agent
**只按 User-Agent 放行有伪装风险,也容易误伤。**更安全的做法是把“已验证机器人类别、路径、速率、响应状态、缓存策略”组合起来。
建议优先级如下:
- verified bot 或 CDN 官方识别类别;
- 明确的 AI Search / Search Engine / Advertising crawler;
- 核心公开路径白名单;
- 低风险限速,而不是直接封禁;
- 对训练类爬虫按目录和内容资产价值分层;
- 保留日志字段,方便回溯。
不建议为了“进 AI”完全关闭 WAF。正确目标不是让所有爬虫进来,而是让应该代表你进入 AI 答案体系的页面稳定被读取。
修复后如何确认 AI 可见性恢复?
**技术放行不等于马上被 AI 引用。**修复后至少观察 2–4 周,结合访问日志、AI 答案采样和品牌问法监控判断是否恢复。
建议记录三类指标:
- 可达性指标:AI UA 请求状态码、响应体长度、核心 URL 200 占比。
- 抓取指标:不同 AI bot 的访问频次、目录分布、重复抓取率。
- 答案指标:品牌是否被提及、是否带链接、是否引用正确页面、是否把竞品排在前面。
这部分最好纳入持续监控,而不是一次性排查。可参考品牌 AI 搜索可见性监控框架建立样本、问法和复盘节奏。
常见问题
CDN拦截AI爬虫会影响 Google 收录吗?
不一定。传统 Googlebot 可能仍被允许,但某些混合用途或 AI 相关访问可能受限。需要分别测试 Googlebot、Google-Extended、AI Search 类爬虫和训练类爬虫,不能用“Google 正常收录”推断 AI 一定可读。
返回 403 一定是 CDN 的问题吗?
不是。403 也可能来自源站鉴权、Nginx 规则、WordPress 安全插件、地区封禁、反爬中间件或应用层黑名单。判断关键是:请求是否进入源站日志;如果没有,优先查 CDN/WAF。
是否应该放行 GPTBot?
取决于目标。GPTBot 更偏训练用途,OAI-SearchBot 更接近搜索发现用途。若目标是被 AI 搜索理解和引用,应优先确保搜索类爬虫可访问;训练类爬虫则按内容版权、商业价值和服务器负载决定。
只写 llms.txt 能解决 403 吗?
不能。llms.txt 是给 AI 系统理解站点内容结构的辅助文件,不能绕过 CDN、WAF 或验证码。如果边缘层已经返回 403,AI 爬虫连页面都读不到,llms.txt 也无法替代网络放行。
小团队没有安全工程师,先做哪三件事?
先做三件低成本动作:公网请求 robots.txt 最终版本;用 3–5 个 AI crawler UA 测核心页面状态码;在 CDN 控制台搜索这些请求是否命中安全规则。若发现边缘层拦截,再让技术按路径和爬虫类别最小化放行。
结论:AEO 的第一步是“让 AI 读得到”
CDN拦截AI爬虫不是单纯的安全问题,而是品牌 AI 搜索可见性的基础设施问题。内容再完整,如果被边缘规则挡在门外,AI 答案也很难把你纳入候选信源。
更合理的做法是:保留安全边界,区分搜索、代理和训练用途,放行核心公开页面,限制高风险目录,并用日志和答案采样验证效果。这样既不裸奔,也不把未来的 AI 入口一并关掉。
