国产 ai bot 白名单配置:robots、WAF 与日志验证指南

国产 ai bot 白名单配置:robots、WAF 与日志验证指南

作者:maxaeo.cn|发布日期:2026-09-03|更新日期:2026-09-03

国产 ai bot 白名单配置的目标,不是“对所有机器人开门”,而是让公开、可被引用的内容能被豆包、Kimi、DeepSeek、元宝、通义千问等 AI 搜索链路读取,同时避免后台、接口、隐私页被误放行。

更稳妥的做法是分三层处理:robots.txt 表达抓取意愿,WAF/CDN 做边缘放行,日志与 AI 回答做结果验证。只改其中一层,常见结果是“爬虫看似允许,实际仍被 403、挑战页或登录墙挡住”。

国产 ai bot 白名单配置的三层放行流程图

什么是国产 AI bot 白名单?

国产 AI bot 白名单是网站针对国内 AI 平台相关爬虫、检索代理或内容抓取请求建立的允许规则。它通常覆盖 robots.txt、WAF、自定义防火墙、CDN Bot 策略和服务器访问控制。

它和传统搜索引擎白名单不同:传统 SEO 更关注百度、Google、Bing 的索引抓取;AI 搜索还要关注答案生成时是否能读取页面、是否引用具体 URL、是否正确描述品牌。
因此,国产 ai bot 白名单配置要同时服务两个目标:可抓取可被理解

如果你已经做过 Cloudflare 层面的搜索爬虫放行,可进一步参考 Cloudflare 机器人白名单配置指南,把传统搜索爬虫与 AI 爬虫分开管理。

哪些国产 AI bot 需要优先识别?

优先识别的不是“所有 AI 名称”,而是已经能在日志中稳定出现、或官方公开说明了爬虫标识的请求。对无法确认的 UA,不建议直接全站放行。

平台/生态 常见识别思路 配置建议
Kimi 官方公开 KimiBot 爬虫说明,可按 UA 与路径规则识别 可在 robots.txt 与 WAF 中单独放行公开内容
豆包/字节生态 常见讨论会涉及 Bytespider,但官方公开信息与行为一致性需谨慎核验 不建议仅凭名称全站放行,应结合日志频率和访问路径
DeepSeek 第三方目录常见 DeepSeekBot 说法,但官方稳定 UA 与 IP 段公开程度有限 可写兼容规则,但必须用日志与 AI 引用结果复核
腾讯元宝、通义、文心等 很多抓取行为可能通过搜索索引、浏览器代理或合作信源间接完成 重点保障公开页面、结构化内容和主流搜索可访问

Kimi 官方已提供 Kimi Crawlers 页面,可用于确认 KimiBot 的 User-Agent 与 robots 控制方式,配置前建议核对 Kimi 官方爬虫说明
对于 DeepSeek,可先阅读 DeepSeekBot User-Agent 放行与验证清单,不要把第三方目录里的字符串当成唯一依据。

robots.txt 应该怎么写?

robots.txt 适合表达“哪些公开路径允许抓取”,不适合承担安全防护职责。Google 对 robots.txt 的解释也强调,核心可解析字段主要是 user-agent、allow、disallow,并支持 sitemap 字段。

一个面向 AI 搜索可见性的基础写法如下:

User-agent: *
Disallow: /admin/
Disallow: /login/
Disallow: /api/
Disallow: /checkout/
Allow: /blog/
Allow: /docs/
Allow: /solutions/

User-agent: KimiBot
Allow: /blog/
Allow: /docs/
Allow: /solutions/
Disallow: /admin/
Disallow: /login/
Disallow: /api/

User-agent: DeepSeekBot
Allow: /blog/
Allow: /docs/
Allow: /solutions/
Disallow: /admin/
Disallow: /login/
Disallow: /api/

Sitemap: https://www.example.com/sitemap.xml

这段配置的关键不是“列了多少 bot”,而是路径边界清楚:内容页、文档页、解决方案页开放;后台、登录、接口、交易、用户数据页关闭
根据 Google robots.txt 规范说明,不要依赖非标准字段解决抓取频率问题;频率控制应放到 WAF、CDN 或服务器限速层。

WAF 和 CDN 白名单怎么配?

WAF/CDN 层要做“最小放行”:只对确认需要被 AI 读取的公开路径跳过误拦规则,而不是对某个 UA 全站免检。这样能兼顾 AI 可见性和安全边界。

推荐规则顺序如下:

  1. 先匹配路径/blog//docs//solutions//robots.txt/sitemap.xml/llms.txt
  2. 再匹配 UA:如 KimiBot、明确记录到的 AI crawler token。
  3. 限制方法:通常只允许 GETHEAD
  4. 保留日志:放行规则必须继续记录请求,方便复测。
  5. 设置速率阈值:异常高频请求仍应限速或挑战。

在 Cloudflare 中,常见做法是使用 Skip 或自定义规则跳过特定安全组件。Cloudflare 官方文档说明 Skip 动作可用于跳过部分 WAF、安全或限速组件,落地时可参考 Cloudflare WAF Skip 动作说明
如果你只想开放特定路径,可参考 Cloudflare 按路径放行爬虫,避免把全站暴露给不确定爬虫。

WAF 中按路径和 User-Agent 最小放行 AI 爬虫

一套可复用的“四层白名单矩阵”

更适合企业官网的做法,是把国产 ai bot 白名单配置拆成四层矩阵,而不是维护一份越来越长的 UA 清单。

层级 要解决的问题 推荐动作 不建议做法
协议层 是否允许抓取 robots.txt、sitemap、llms.txt 用 robots 当安全墙
边缘层 是否被 WAF/CDN 误拦 路径 + UA + 方法最小放行 对 bot UA 全站放行
内容层 AI 是否读得懂 标题、摘要、问答块、事实表、产品页结构化 只有品牌口号,没有明确答案
验证层 是否真的进入 AI 回答 日志、状态码、引用 URL、提及率趋势 只看访问量,不看回答结果

这套矩阵的独特价值在于把“抓取配置”与“AI 答案结果”连接起来。很多网站日志里有 AI bot 访问,但品牌仍不被推荐,原因通常不在白名单,而在内容缺少可引用的答案段、对比表、价格/功能事实或第三方信源支撑。

MaxAEO 在做 AI 搜索可见性诊断时,也会把提及率、推荐位次、情感倾向和引用来源放在同一张基线中观察。需要排查品牌为什么被或不被引用,可结合 AI 引用来源分析方法 看信源结构,而不只看爬虫日志。

如何验证白名单真的生效?

验证应分为“访问成功”和“答案可见”两步。前者看服务器日志,后者看 AI 平台回答;只有两者同时成立,白名单才算对业务产生了效果。

建议按 72 小时窗口做一次复核:

  1. 检查 robots 可访问:确认 https://example.com/robots.txt 返回 200,内容无缓存旧版本。
  2. 检查关键路径状态码:公开内容页对目标 UA 返回 200,不返回 403、429、503 或挑战页。
  3. 检查日志字段:记录时间、IP、UA、路径、状态码、响应字节、referer、WAF 动作。
  4. 检查抓取深度:AI bot 是否只访问首页,还是进入了文章页、文档页、产品页。
  5. 检查 AI 回答:用固定问题矩阵询问豆包、Kimi、DeepSeek 等平台,看是否提及品牌、是否引用自有页面。
  6. 同口径复测:配置前后使用同一批问题、同一批平台、同一统计口径比较。

如果需要把日志验证和 AI 回答验证串起来,可参考 deepseek 爬虫抓取验证方法
对品牌侧来说,最终指标不只是“爬虫来过”,而是 AI 回答中的提及率、排序位置、引用来源占比和描述准确度

哪些页面应该放行,哪些必须排除?

应该优先放行能帮助 AI 正确理解品牌的公开页面;必须排除登录、支付、用户数据、内部搜索、接口和低质量参数页。白名单越宽,安全和抓取噪音越高。

建议优先放行:

  • 品牌首页与核心产品页;
  • 解决方案页、行业页、案例页;
  • 文档、帮助中心、FAQ、博客深度文章;
  • robots.txtsitemap.xmlllms.txt
  • 可公开的对比页、定价说明页、集成说明页。

建议默认排除:

  • /admin//login//user/
  • /api//checkout//cart/
  • 站内搜索结果页;
  • 带大量筛选参数、排序参数的重复页面;
  • 预览页、测试页、未发布页面;
  • 包含客户私有数据的附件与下载目录。

对 SaaS 网站而言,最值得开放的是“能回答采购问题”的页面,例如功能边界、适用场景、竞品差异、数据安全、部署方式、价格口径和客户案例。AI 引擎更容易引用结构明确、事实密度高、可独立摘录的内容块。

常见错误:为什么放行后仍然没有 AI 曝光?

放行后没有 AI 曝光,通常不是单点配置失败,而是“抓取、理解、引用、复测”其中一环断了。最常见的错误有五类。

第一,只在 robots.txt 写 Allow: /,但 WAF 仍把 AI bot 判定为自动化流量并挑战。
第二,放行了首页,却屏蔽了真正有信息量的博客、文档或解决方案页。
第三,页面依赖大量 JavaScript 渲染,爬虫拿到的是空壳 HTML。
第四,内容只有营销口号,没有“是什么、适合谁、怎么选、与竞品差异”的答案块。
第五,没有固定问题矩阵,无法判断配置前后 AI 回答是否变化。

MaxAEO 国内版 maxaeo.cn 覆盖豆包、DeepSeek、腾讯元宝、通义千问、文心一言、Kimi、智谱清言、讯飞星火和秘塔搜索 9 个国产 AI 平台,可用于持续监测品牌提及率、排序、情绪评价与引用来源。想先建立基线,可通过 MaxAEO 官网 获取品牌 AI 可见性诊断。

常见问题

国产 ai bot 白名单配置是否等于允许 AI 训练我的内容?

不等于。白名单主要控制抓取访问和边缘拦截,不等同于授权训练。是否用于训练取决于平台政策、内容许可、协议条款和你的站点声明。企业站应同时管理 robots、版权声明、服务条款和敏感内容访问权限。

只写 DeepSeekBot 就能被 DeepSeek 引用吗?

不能保证。DeepSeekBot 相关标识在公开资料中的稳定性仍需谨慎核验。更可靠的做法是开放高质量公开内容,检查日志访问,再用固定问题在 DeepSeek 中复测品牌是否被提及、排序是否变化、回答是否引用了你的页面。

WAF 白名单应该按 IP 还是按 UA 配?

能确认官方 IP 段时,可组合 IP、UA、路径和方法;不能确认时,不建议只按 IP 或只按 UA 全站放行。UA 容易伪造,IP 也可能变化。企业官网更适合“公开路径 + GET/HEAD + 日志保留 + 限速”的最小放行策略。

llms.txt 能替代 robots.txt 吗?

不能。robots.txt 更偏访问控制,llms.txt 更偏向向大模型说明站点结构、重点页面和可引用内容。两者可以配合:robots 确保可抓取边界,llms 帮助 AI 更快理解哪些页面值得读取。

怎么判断 AI bot 放行带来了业务价值?

不要只看访问量。应看同一批问题在多个 AI 平台中的提及率、推荐位次、引用来源、自有域名占比和情感描述是否改善。MaxAEO 支持按平台和时间维度持续监测这些指标,并保留 AI 原始回答用于回溯。