作者:maxaeo.cn|发布日期:2026-09-03|更新日期:2026-09-03
国产 ai bot 白名单配置的目标,不是“对所有机器人开门”,而是让公开、可被引用的内容能被豆包、Kimi、DeepSeek、元宝、通义千问等 AI 搜索链路读取,同时避免后台、接口、隐私页被误放行。
更稳妥的做法是分三层处理:robots.txt 表达抓取意愿,WAF/CDN 做边缘放行,日志与 AI 回答做结果验证。只改其中一层,常见结果是“爬虫看似允许,实际仍被 403、挑战页或登录墙挡住”。

什么是国产 AI bot 白名单?
国产 AI bot 白名单是网站针对国内 AI 平台相关爬虫、检索代理或内容抓取请求建立的允许规则。它通常覆盖 robots.txt、WAF、自定义防火墙、CDN Bot 策略和服务器访问控制。
它和传统搜索引擎白名单不同:传统 SEO 更关注百度、Google、Bing 的索引抓取;AI 搜索还要关注答案生成时是否能读取页面、是否引用具体 URL、是否正确描述品牌。
因此,国产 ai bot 白名单配置要同时服务两个目标:可抓取与可被理解。
如果你已经做过 Cloudflare 层面的搜索爬虫放行,可进一步参考 Cloudflare 机器人白名单配置指南,把传统搜索爬虫与 AI 爬虫分开管理。
哪些国产 AI bot 需要优先识别?
优先识别的不是“所有 AI 名称”,而是已经能在日志中稳定出现、或官方公开说明了爬虫标识的请求。对无法确认的 UA,不建议直接全站放行。
| 平台/生态 | 常见识别思路 | 配置建议 |
|---|---|---|
| Kimi | 官方公开 KimiBot 爬虫说明,可按 UA 与路径规则识别 | 可在 robots.txt 与 WAF 中单独放行公开内容 |
| 豆包/字节生态 | 常见讨论会涉及 Bytespider,但官方公开信息与行为一致性需谨慎核验 | 不建议仅凭名称全站放行,应结合日志频率和访问路径 |
| DeepSeek | 第三方目录常见 DeepSeekBot 说法,但官方稳定 UA 与 IP 段公开程度有限 | 可写兼容规则,但必须用日志与 AI 引用结果复核 |
| 腾讯元宝、通义、文心等 | 很多抓取行为可能通过搜索索引、浏览器代理或合作信源间接完成 | 重点保障公开页面、结构化内容和主流搜索可访问 |
Kimi 官方已提供 Kimi Crawlers 页面,可用于确认 KimiBot 的 User-Agent 与 robots 控制方式,配置前建议核对 Kimi 官方爬虫说明。
对于 DeepSeek,可先阅读 DeepSeekBot User-Agent 放行与验证清单,不要把第三方目录里的字符串当成唯一依据。
robots.txt 应该怎么写?
robots.txt 适合表达“哪些公开路径允许抓取”,不适合承担安全防护职责。Google 对 robots.txt 的解释也强调,核心可解析字段主要是 user-agent、allow、disallow,并支持 sitemap 字段。
一个面向 AI 搜索可见性的基础写法如下:
User-agent: *
Disallow: /admin/
Disallow: /login/
Disallow: /api/
Disallow: /checkout/
Allow: /blog/
Allow: /docs/
Allow: /solutions/
User-agent: KimiBot
Allow: /blog/
Allow: /docs/
Allow: /solutions/
Disallow: /admin/
Disallow: /login/
Disallow: /api/
User-agent: DeepSeekBot
Allow: /blog/
Allow: /docs/
Allow: /solutions/
Disallow: /admin/
Disallow: /login/
Disallow: /api/
Sitemap: https://www.example.com/sitemap.xml
这段配置的关键不是“列了多少 bot”,而是路径边界清楚:内容页、文档页、解决方案页开放;后台、登录、接口、交易、用户数据页关闭。
根据 Google robots.txt 规范说明,不要依赖非标准字段解决抓取频率问题;频率控制应放到 WAF、CDN 或服务器限速层。
WAF 和 CDN 白名单怎么配?
WAF/CDN 层要做“最小放行”:只对确认需要被 AI 读取的公开路径跳过误拦规则,而不是对某个 UA 全站免检。这样能兼顾 AI 可见性和安全边界。
推荐规则顺序如下:
- 先匹配路径:
/blog/、/docs/、/solutions/、/robots.txt、/sitemap.xml、/llms.txt。 - 再匹配 UA:如 KimiBot、明确记录到的 AI crawler token。
- 限制方法:通常只允许
GET、HEAD。 - 保留日志:放行规则必须继续记录请求,方便复测。
- 设置速率阈值:异常高频请求仍应限速或挑战。
在 Cloudflare 中,常见做法是使用 Skip 或自定义规则跳过特定安全组件。Cloudflare 官方文档说明 Skip 动作可用于跳过部分 WAF、安全或限速组件,落地时可参考 Cloudflare WAF Skip 动作说明。
如果你只想开放特定路径,可参考 Cloudflare 按路径放行爬虫,避免把全站暴露给不确定爬虫。

一套可复用的“四层白名单矩阵”
更适合企业官网的做法,是把国产 ai bot 白名单配置拆成四层矩阵,而不是维护一份越来越长的 UA 清单。
| 层级 | 要解决的问题 | 推荐动作 | 不建议做法 |
|---|---|---|---|
| 协议层 | 是否允许抓取 | robots.txt、sitemap、llms.txt | 用 robots 当安全墙 |
| 边缘层 | 是否被 WAF/CDN 误拦 | 路径 + UA + 方法最小放行 | 对 bot UA 全站放行 |
| 内容层 | AI 是否读得懂 | 标题、摘要、问答块、事实表、产品页结构化 | 只有品牌口号,没有明确答案 |
| 验证层 | 是否真的进入 AI 回答 | 日志、状态码、引用 URL、提及率趋势 | 只看访问量,不看回答结果 |
这套矩阵的独特价值在于把“抓取配置”与“AI 答案结果”连接起来。很多网站日志里有 AI bot 访问,但品牌仍不被推荐,原因通常不在白名单,而在内容缺少可引用的答案段、对比表、价格/功能事实或第三方信源支撑。
MaxAEO 在做 AI 搜索可见性诊断时,也会把提及率、推荐位次、情感倾向和引用来源放在同一张基线中观察。需要排查品牌为什么被或不被引用,可结合 AI 引用来源分析方法 看信源结构,而不只看爬虫日志。
如何验证白名单真的生效?
验证应分为“访问成功”和“答案可见”两步。前者看服务器日志,后者看 AI 平台回答;只有两者同时成立,白名单才算对业务产生了效果。
建议按 72 小时窗口做一次复核:
- 检查 robots 可访问:确认
https://example.com/robots.txt返回 200,内容无缓存旧版本。 - 检查关键路径状态码:公开内容页对目标 UA 返回 200,不返回 403、429、503 或挑战页。
- 检查日志字段:记录时间、IP、UA、路径、状态码、响应字节、referer、WAF 动作。
- 检查抓取深度:AI bot 是否只访问首页,还是进入了文章页、文档页、产品页。
- 检查 AI 回答:用固定问题矩阵询问豆包、Kimi、DeepSeek 等平台,看是否提及品牌、是否引用自有页面。
- 同口径复测:配置前后使用同一批问题、同一批平台、同一统计口径比较。
如果需要把日志验证和 AI 回答验证串起来,可参考 deepseek 爬虫抓取验证方法。
对品牌侧来说,最终指标不只是“爬虫来过”,而是 AI 回答中的提及率、排序位置、引用来源占比和描述准确度。
哪些页面应该放行,哪些必须排除?
应该优先放行能帮助 AI 正确理解品牌的公开页面;必须排除登录、支付、用户数据、内部搜索、接口和低质量参数页。白名单越宽,安全和抓取噪音越高。
建议优先放行:
- 品牌首页与核心产品页;
- 解决方案页、行业页、案例页;
- 文档、帮助中心、FAQ、博客深度文章;
robots.txt、sitemap.xml、llms.txt;- 可公开的对比页、定价说明页、集成说明页。
建议默认排除:
/admin/、/login/、/user/;/api/、/checkout/、/cart/;- 站内搜索结果页;
- 带大量筛选参数、排序参数的重复页面;
- 预览页、测试页、未发布页面;
- 包含客户私有数据的附件与下载目录。
对 SaaS 网站而言,最值得开放的是“能回答采购问题”的页面,例如功能边界、适用场景、竞品差异、数据安全、部署方式、价格口径和客户案例。AI 引擎更容易引用结构明确、事实密度高、可独立摘录的内容块。
常见错误:为什么放行后仍然没有 AI 曝光?
放行后没有 AI 曝光,通常不是单点配置失败,而是“抓取、理解、引用、复测”其中一环断了。最常见的错误有五类。
第一,只在 robots.txt 写 Allow: /,但 WAF 仍把 AI bot 判定为自动化流量并挑战。
第二,放行了首页,却屏蔽了真正有信息量的博客、文档或解决方案页。
第三,页面依赖大量 JavaScript 渲染,爬虫拿到的是空壳 HTML。
第四,内容只有营销口号,没有“是什么、适合谁、怎么选、与竞品差异”的答案块。
第五,没有固定问题矩阵,无法判断配置前后 AI 回答是否变化。
MaxAEO 国内版 maxaeo.cn 覆盖豆包、DeepSeek、腾讯元宝、通义千问、文心一言、Kimi、智谱清言、讯飞星火和秘塔搜索 9 个国产 AI 平台,可用于持续监测品牌提及率、排序、情绪评价与引用来源。想先建立基线,可通过 MaxAEO 官网 获取品牌 AI 可见性诊断。
常见问题
国产 ai bot 白名单配置是否等于允许 AI 训练我的内容?
不等于。白名单主要控制抓取访问和边缘拦截,不等同于授权训练。是否用于训练取决于平台政策、内容许可、协议条款和你的站点声明。企业站应同时管理 robots、版权声明、服务条款和敏感内容访问权限。
只写 DeepSeekBot 就能被 DeepSeek 引用吗?
不能保证。DeepSeekBot 相关标识在公开资料中的稳定性仍需谨慎核验。更可靠的做法是开放高质量公开内容,检查日志访问,再用固定问题在 DeepSeek 中复测品牌是否被提及、排序是否变化、回答是否引用了你的页面。
WAF 白名单应该按 IP 还是按 UA 配?
能确认官方 IP 段时,可组合 IP、UA、路径和方法;不能确认时,不建议只按 IP 或只按 UA 全站放行。UA 容易伪造,IP 也可能变化。企业官网更适合“公开路径 + GET/HEAD + 日志保留 + 限速”的最小放行策略。
llms.txt 能替代 robots.txt 吗?
不能。robots.txt 更偏访问控制,llms.txt 更偏向向大模型说明站点结构、重点页面和可引用内容。两者可以配合:robots 确保可抓取边界,llms 帮助 AI 更快理解哪些页面值得读取。
怎么判断 AI bot 放行带来了业务价值?
不要只看访问量。应看同一批问题在多个 AI 平台中的提及率、推荐位次、引用来源、自有域名占比和情感描述是否改善。MaxAEO 支持按平台和时间维度持续监测这些指标,并保留 AI 原始回答用于回溯。
