国产 AI 爬虫放行规则:robots、UA、WAF 与 CDN 配置清单

国产 AI 爬虫放行规则:robots、UA、WAF 与 CDN 配置清单

作者:maxaeo.cn|发布日期:2026-09-03|更新日期:2026-09-03

国产 AI 爬虫放行规则的核心不是“无条件放开所有机器人”,而是让豆包、DeepSeek、Kimi、通义千问、文心一言等 AI 引擎能读取官网公开内容,同时继续拦截后台、接口、搜索页和异常高频请求。

对 SaaS、工具、电商和 B2B 官网来说,这件事会直接影响 GEO/AEO 优化:如果 AI 引擎无法抓到产品页、文档页、案例页和价格说明,它就更容易引用第三方旧资料,甚至讲错品牌能力。

国产 AI 爬虫放行规则的 robots、WAF、CDN 与日志验证流程图

什么是国产 AI 爬虫放行规则?

国产 AI 爬虫放行规则,是一组让 AI 相关抓取请求访问公开页面、同时限制敏感路径和异常流量的技术配置,通常覆盖 robots.txt、User-Agent 识别、WAF 例外、CDN Bot 策略和访问日志复核。

它与传统 SEO 爬虫放行不同。百度、搜狗等搜索爬虫通常有较成熟的站长平台和验证路径,而部分 AI 相关爬虫的公开文档并不完整。因此,官网不能只写一段 robots.txt 就结束,还要验证请求是否真的拿到 200 状态码、是否被安全策略挑战、是否进入 AI 回答的引用链路。

官网为什么“写了 Allow”仍可能不被 AI 读到?

robots.txt 只表达抓取许可,不等于网络层已经放行。很多官网真正的问题出在 CDN、WAF、人机验证、JS 挑战、地域策略、登录墙或源站限速,AI 爬虫在这些环节会收到 403、429 或空 HTML。

RFC 9309 的 Robots Exclusion Protocol定义了 robots.txt 的基础匹配方式;Google 关于创建 robots.txt 的文档也说明了 user-agent、allow、disallow 等规则的作用边界。结论很明确:robots 是声明层,WAF/CDN 是执行层,日志与 AI 结果才是验收层。

常见误区有四类:

  1. User-agent: * Disallow: / 仍保留在生产环境;
  2. WAF 把无 Cookie、无 JS 执行能力的请求判定为恶意机器人;
  3. CDN 开启 Bot 管理后,只默认放行传统搜索引擎;
  4. 内容主体依赖前端渲染,爬虫拿到的是空壳页面。

可复制的 robots.txt 最小放行模板

安全的放行原则是:公开内容允许抓取,业务后台和低价值路径继续屏蔽。不要为了“让 AI 看见”而开放登录页、账户中心、内部 API、站内搜索结果和带参数的重复页面。

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /account/
Disallow: /api/
Disallow: /search
Disallow: /*?*

User-agent: Bytespider
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /account/
Disallow: /api/

User-agent: Baiduspider
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /account/
Disallow: /api/

Sitemap: https://www.example.com/sitemap.xml

这里没有把所有国产 AI 平台都写成确定 UA,是因为部分平台并未持续公开可核验的专用爬虫标识。比如 DeepSeekBot 在第三方目录中常被提及,但公开可验证资料有限,企业更应结合日志、响应码和引用结果判断。若要进一步拆分,可参考站内的国产 ai bot 白名单配置指南DeepSeekBot User-agent 写法清单

WAF 与 CDN 应该怎么放行?

WAF/CDN 放行应采用“最小例外”:只对可信 UA、公共路径、GET/HEAD 方法和合理频率降低误拦,不要直接跳过全部安全规则。这样既能提升 AI 可读性,也能避免被伪造 UA 的爬虫滥用。

可用这张表做配置口径:

层级 建议放行 仍需拦截 验收指标
robots.txt 官网、博客、文档、案例、产品页 后台、登录、账户、API、搜索页 文件 200,可被直接访问
UA 识别 命中特定 AI/搜索爬虫 token 空 UA、伪装浏览器的高频请求 日志中 UA 可检索
WAF 公共路径的 GET/HEAD POST、撞库、扫描、异常参数 403 明显下降
CDN 静态资源、HTML 正常回源 地域异常、突发高频、缓存穿透 200/304 占比提升
内容层 服务端可见正文、结构化标题 纯 JS 空壳、登录后内容 curl 可读到核心文案

使用 Cloudflare 的网站可关注官方的Verified Bots 与 WAF 放行说明,并结合站内的Cloudflare WAF 例外规则配置收窄范围。阿里云 WAF 用户可参考阿里云合法爬虫放行功能,但要注意其默认覆盖更多是传统搜索爬虫,不等于所有 AI 爬虫都会被自动识别。

WAF 与 CDN 对 AI 爬虫最小放行的配置示意图

一套四层验收矩阵:别只看配置,要看结果

判断官网能不能被 AI 引擎读到,应按“声明、访问、内容、引用”四层验收。只要其中一层断掉,AI 搜索可见性就可能失真:robots 允许但 WAF 拦截,或页面 200 但正文为空,都不能算真正可读。

MaxAEO 在做品牌 AI 基线诊断时,常把官网可读性拆成四个问题:

  1. 声明层/robots.txt 是否 200?是否误写全站禁止?
  2. 访问层:目标页面对爬虫 UA 是否返回 200/304,而非 403/429/503?
  3. 内容层:首屏 HTML 是否包含品牌名、产品定义、适用场景、价格或方案入口?
  4. 引用层:AI 回答是否引用官网、自有博客、文档或权威第三方页面?

一个脱敏复盘示例:某 B2B SaaS 官网公开页均可由浏览器访问,但在边缘安全日志中,文档目录对无 Cookie 请求返回 403。修复前,10 个采购类问题里 AI 更多引用软件下载站和旧新闻;修复 robots、WAF 路径例外和文档页服务端正文后,再用同一问题矩阵复测,官网相关引用开始出现,负面旧描述减少。这个案例的关键不是“放行某个 UA”,而是把抓取、内容和复测放进同一闭环。

哪些页面最值得优先开放给 AI 读取?

优先放行能回答采购问题的页面:产品页、功能页、价格页、行业方案、客户案例、帮助文档、对比页和关于我们。AI 引擎在生成推荐时,更需要稳定、结构化、可引用的事实来源,而不是营销口号。

建议按优先级处理:

  1. 品牌事实页:公司名称、产品定位、服务范围、联系方式;
  2. 购买决策页:价格、套餐、适用对象、部署方式、安全说明;
  3. 场景解决方案页:按行业、角色、任务说明具体价值;
  4. 证据页:案例、教程、白皮书、更新日志、FAQ;
  5. 机器可读辅助文件:sitemap、结构化数据、可选的 llms.txt。

如果已上线 llms.txt,不要把它当成 robots 的替代品。可用llms.txt 文件检测清单确认文件存在、可访问、内容不冲突;再用AI 引用来源分析方法判断这些页面是否真的进入 AI 信源。

放行后如何持续监测是否生效?

放行后的验证至少持续 7–14 天,并使用同一批问题、同一批平台、同一统计口径复测。单日 AI 回答有波动,不能因为一次出现或消失就判断规则成功或失败。

建议记录三组指标:

  • 抓取侧:AI/搜索相关 UA 的请求次数、状态码、路径、带宽、WAF 命中事件;
  • 内容侧:核心页面是否被成功返回,正文是否出现在 HTML 中;
  • AI 结果侧:品牌提及率、推荐位次、情绪倾向、引用来源、自有域名占比。

MaxAEO 国内版覆盖豆包、DeepSeek、腾讯元宝、Kimi、通义千问、文心一言等 9 个中国大陆 AI 平台,支持监测品牌提及率、排序、情绪评价与引用来源。企业可先用 MaxAEO 免费诊断建立基线,再结合日志排查确认“爬虫已访问”与“AI 已引用”之间的差距。

国产 AI 爬虫放行规则生效后的日志与 AI 引用验证看板

常见问题

只要放行 Bytespider,就等于豆包一定会引用官网吗?

不等于。Bytespider 常被视为字节系抓取的重要线索,但 AI 是否引用还取决于页面质量、权威性、内容结构、更新频率和模型检索策略。放行只是进入候选信源的前置条件。

DeepSeekBot 要不要单独写进 robots.txt?

可以写,但不应只依赖这一个动作。由于公开可验证资料有限,更稳妥的做法是保留公共内容对 User-agent: * 可抓取,同时用日志观察疑似 DeepSeek 相关请求是否被 WAF/CDN 拦截。

WAF 白名单能不能只按 User-Agent 放行?

不建议。UA 很容易伪造,单独按 UA 放行会扩大风险。更安全的规则应叠加路径、方法、频率、响应码和必要的 Bot 验证能力,只对公开内容降级拦截。

AI 爬虫需要访问 CSS 和 JS 吗?

至少不要阻断影响页面理解的关键资源。但更重要的是,核心正文应在服务端 HTML 中可见。若产品信息完全依赖前端接口加载,许多爬虫可能读不到完整内容。

放行后多久能看到 AI 搜索变化?

没有固定时间。建议先观察 7–14 天日志,再用同一问题矩阵复测 AI 回答。若抓取正常但仍不引用,应继续补足内容结构、权威信源和第三方可验证资料。