Cloudflare 放行 DeepSeek 爬虫:从 robots.txt 到 WAF 的最小配置

Cloudflare 放行 DeepSeek 爬虫:从 robots.txt 到 WAF 的最小配置

作者:maxaeo.cn|发布日期:2026-08-28|更新日期:2026-08-28

**Cloudflare 放行 DeepSeek 爬虫的关键,不是简单加一行 User-agent,而是确认 DeepSeek 相关访问是否被 robots.txt、AI 爬虫控制、Bot Fight Mode、WAF、自定义限速或 JS 挑战拦截。**如果官网内容希望被 DeepSeek 联网搜索理解与引用,建议采用“最小放行”:只放行公开内容页,不放行后台、接口、登录页和高成本动态页。

Cloudflare 放行 DeepSeek 爬虫的四层排查路径示意图

什么是 Cloudflare 放行 DeepSeek 爬虫?

Cloudflare 放行 DeepSeek 爬虫,指在不降低网站安全性的前提下,让 DeepSeek 联网搜索或相关抓取链路能够访问公开页面,避免返回 403、429、验证码页或空白 JS 页面。

这里要先澄清一个常见误区:截至本文发布日,DeepSeek 没有像部分海外 AI 爬虫那样公开、稳定、可验证的官方站外爬虫说明页。DeepSeek 用户协议提到其产品存在“联网搜索”能力,开启后会检索公开信息生成内容,可参见 DeepSeek 用户协议对联网搜索的说明。但这不等于站长一定能用单一 User-Agent 精准识别所有 DeepSeek 抓取请求。

因此,实务上不要把“放行 DeepSeek”理解成“完全信任 DeepSeekBot”。更稳妥的目标是:让公开、可索引、可被引用的页面对 AI 搜索抓取链路友好,同时保留对未知高频请求的限速和审计。

为什么只改 robots.txt 往往不生效?

robots.txt 只表达抓取许可,不会绕过 Cloudflare 的安全拦截。即使 robots.txt 允许访问,Cloudflare 的 AI Crawl Control、WAF、Bot Fight Mode 或速率限制仍可能返回 403、429 或挑战页。

推荐先检查三类信号:

  1. 协议层/robots.txt 是否误把全站 Disallow: /,或把内容目录排除。
  2. 边缘安全层:Cloudflare 是否开启了拦截 AI 爬虫、Bot Fight Mode、托管规则或自定义 WAF。
  3. 页面可读层:公开内容是否依赖登录、Cookie、复杂 JS 渲染或接口异步加载。

Cloudflare 官方文档说明,站点可以通过相关产品识别和控制 AI 爬虫,并建议参考其持续更新的机器人目录;可对照 Cloudflare AI Crawl Control 的机器人参考。但 DeepSeek 相关标识在公开资料中并不稳定,所以日志验证比照抄名单更重要。

最小放行规则:先放公开内容页,不放全站

最小放行的原则是“按路径、按行为、按风险分层”。官网、博客、文档、价格页、案例页可以优先放行;登录、管理后台、搜索接口、支付页、私有文件应继续拦截。

页面类型 建议策略 原因
/blog//docs//pricing/ 允许抓取,保留基础限速 这些页面最容易成为 AI 回答引用来源
/admin//login//account/ 禁止或挑战 无公开引用价值,且安全风险高
/api/、站内搜索接口 限速或禁止 容易被高频请求打穿成本
图片、CSS、JS 通常允许 有助于页面正常渲染与内容解析
参数页、筛选页 视情况规范化 避免重复内容和无限抓取

一个更安全的 robots.txt 起点如下:

User-agent: *
Allow: /blog/
Allow: /docs/
Allow: /pricing/
Disallow: /admin/
Disallow: /login/
Disallow: /account/
Disallow: /api/
Sitemap: https://example.com/sitemap.xml

如果你仍想兼容第三方目录里出现过的 DeepSeekBot 写法,可以加一段“非依赖式允许”,但不要把它当成唯一方案:

User-agent: DeepSeekBot
Allow: /blog/
Allow: /docs/
Allow: /pricing/
Disallow: /admin/
Disallow: /login/
Disallow: /api/

更完整的 AI 爬虫协议思路,可参考 MaxAEO 的 deepseek爬虫抓取协议配置指南

Cloudflare 后台应检查哪些开关?

Cloudflare 后台优先检查四处:AI 爬虫控制、Bot Fight Mode、WAF 自定义规则、速率限制。真正的放行通常发生在这些位置,而不是 robots.txt 文件里。

1. AI Crawl Control 或 Block AI Bots

如果站点启用了 AI 爬虫拦截功能,先确认是否把“AI Search Crawler”和“AI Data Scraper”混在一起全量阻断。Cloudflare 的 Block AI Bots 文档 已说明不同 AI 机器人类别可能被不同策略处理,站长应按业务意图选择。

建议做法:

  • 训练型爬虫:可按版权和资源策略限制。
  • 搜索/引用型爬虫:公开内容页可更宽松。
  • 未知高频请求:不直接信任,进入限速和日志观察。

2. Bot Fight Mode 或 Super Bot Fight Mode

Bot Fight Mode 常见误伤是给 AI 抓取链路返回挑战页。对搜索引擎、AI 搜索、监控服务都可能造成“人看正常,机器抓不到”。

如果你已有类似误伤,可参考 MaxAEO 的 Cloudflare Bot Fight Mode 放行方案。建议不要关闭全站防护,而是对公开内容路径增加 Skip 或 Allow 规则,并保留对异常频率的限制。

3. WAF 自定义规则

如果日志里出现 403,重点看 Security Events 中的触发规则名称。常见误伤规则包括:

  • 拦截空 Referer;
  • 拦截非浏览器 UA;
  • 拦截数据中心 IP;
  • 对海外 IP 或未知 ASN 直接挑战;
  • 对所有 AI、bot、crawler 字样统一 block。

更稳的表达式不是“看到 bot 就拦”,而是组合路径和风险:

如果请求路径包含 /blog/ 或 /docs/
且请求方法为 GET
且未命中登录、接口、后台路径
则跳过部分挑战类规则

Cloudflare 规则具体语法会随套餐和产品变化,配置前应以后台可用字段为准。若站点已经出现 AI 抓取 403,可按 大模型抓取 403 原因排查 逐层定位。

30 分钟验证表:如何确认 DeepSeek 真的能读到内容?

验证不是看 robots.txt 是否“写对”,而是看 AI 平台是否能访问、理解、引用并持续更新。建议用“日志—页面—回答—引用”四步闭环。

验证环节 检查方法 合格信号
访问日志 查 DeepSeek 相关时段、UA、IP、状态码 公开页返回 200,非 403/429
Cloudflare 事件 查 Security Events、WAF、Bot 事件 未命中挑战或拦截规则
页面内容 用无登录、无 Cookie 环境访问 首屏和正文可读,不是空壳
AI 回答 在 DeepSeek 联网搜索提问品牌/品类问题 能提到更新后的事实
引用来源 查看回答是否引用官网或目标页 引用 URL 与内容匹配

MaxAEO 在做品牌 AI 基线诊断时,常用“10 个真实问题 × 9 个国产 AI 平台”的采样口径,先记录提及率、推荐位次、情绪和引用来源,再做同口径复测。这个方法的价值在于:它不把单次抓取成功误判为 GEO 成功,而是观察“AI 是否真的把页面当作可信信源”。

如果需要从品牌可见度角度复盘,可以使用 AI 搜索引擎抓取失败排查框架 先判断是协议问题、WAF 问题、渲染问题,还是内容本身缺少可引用结构。

Cloudflare 放行 DeepSeek 爬虫后的日志与引用验证表

一个 SaaS 官网的一手排查框架

对 SaaS 官网,最容易被 AI 引用的不是首页口号,而是“功能页、价格页、对比页、文档页、案例页”。放行 DeepSeek 抓取时,应优先保障这些页面稳定返回 200。

MaxAEO 在 AI 搜索可见性项目中通常把页面分成三层:

  1. 事实层:品牌名、产品类别、核心功能、适用人群、价格口径、官网域名。
  2. 判断层:与竞品差异、适合/不适合场景、选型指标。
  3. 证据层:文档、案例、更新日志、FAQ、可核验页面。

这样做的独特价值是:Cloudflare 放行解决“能不能抓”,结构化内容解决“抓到后能不能引用”。如果只放行爬虫,但页面里没有清晰的产品事实和证据,DeepSeek 仍可能引用第三方旧信息或竞品页面。

MaxAEO 国内版 maxaeo.cn 覆盖 Kimi、DeepSeek、腾讯元宝、豆包、通义千问、文心一言等 9 个中国大陆 AI 平台,可监测品牌提及率、推荐排序、情绪评价与引用来源;用户也可通过 MaxAEO 获取免费 AI 可见性诊断,用于确认官网是否被 AI 正确理解。

推荐的安全配置顺序

安全配置应先保守后放宽,每次只改一个变量。否则一旦流量异常或抓取仍失败,很难判断是哪条规则产生影响。

  1. 备份当前 Cloudflare 规则:记录 AI Crawl Control、WAF、Bot、Rate Limiting 当前状态。
  2. 修正 robots.txt:确保公开内容页允许访问,私有路径继续禁止。
  3. 建立公开路径白名单:只针对 /blog//docs//pricing/ 等 GET 页面。
  4. 保留频率限制:对短时间大量请求继续 429 或 JS 挑战。
  5. 观察 7 天日志:看 200、403、429、5xx 的占比变化。
  6. 做 AI 回答复测:用同一组问题检查 DeepSeek 是否更新事实和引用来源。

如果你的站点同时面对豆包、Kimi、通义千问、元宝等平台,建议结合 国产ai爬虫ua大全 做统一策略,而不是为每个平台单独堆规则。

常见问题

Cloudflare 放行 DeepSeek 爬虫一定要写 DeepSeekBot 吗?

不一定。第三方目录中出现过 DeepSeekBot 相关写法,但 DeepSeek 尚未提供稳定、可核验的官方站外爬虫说明页。robots.txt 可以兼容写入,但真正排查要看 Cloudflare 日志、状态码和 AI 回答引用结果。

放行 AI 爬虫会不会带来安全风险?

会,所以不建议全站放行。正确做法是只放行公开内容页,继续保护登录页、后台、接口、支付页和私有文件,并保留限速、审计和异常告警。

为什么 DeepSeek 还是引用不到我的官网?

可能不是 Cloudflare 问题。常见原因包括页面内容过少、依赖 JS 渲染、缺少明确产品事实、没有 sitemap、标题和正文不一致、第三方信源更强,或 AI 仍使用旧缓存。需要结合日志和回答原文一起判断。

如何判断是 WAF 拦截还是内容质量问题?

如果访问日志显示 403、429、挑战页或空白页面,优先排查 WAF 和 Bot 设置。如果公开页稳定返回 200,但 AI 仍不提及或不引用,问题更可能在内容结构、信源权威度和品牌实体一致性。

MaxAEO 能帮忙看 DeepSeek 是否抓到官网吗?

可以。MaxAEO 提供免费 AI 可见性诊断,可检测品牌在 DeepSeek、豆包、Kimi、通义千问、文心一言等国产 AI 平台中的提及率、排序、情绪与引用来源,帮助判断是抓取问题还是内容信源问题。

结论:放行只是第一步,引用才是目标

Cloudflare 放行 DeepSeek 爬虫的正确目标,不是让所有未知机器人进入网站,而是让公开、高价值、可核验的页面被 AI 搜索稳定读取。最小放行、日志验证、同口径复测,是兼顾安全与 AI 可见性的稳妥路径。

对 SaaS、工具类品牌和内容站来说,建议把 Cloudflare 配置与 GEO/AEO 内容优化放在同一张表里管理:先保证页面能被访问,再保证事实能被理解,最后用 DeepSeek 等 AI 平台的回答和引用来源验证结果。