作者:maxaeo.cn|发布日期:2026-09-03|更新日期:2026-09-03
国产 AI 爬虫放行规则的核心不是“无条件放开所有机器人”,而是让豆包、DeepSeek、Kimi、通义千问、文心一言等 AI 引擎能读取官网公开内容,同时继续拦截后台、接口、搜索页和异常高频请求。
对 SaaS、工具、电商和 B2B 官网来说,这件事会直接影响 GEO/AEO 优化:如果 AI 引擎无法抓到产品页、文档页、案例页和价格说明,它就更容易引用第三方旧资料,甚至讲错品牌能力。

什么是国产 AI 爬虫放行规则?
国产 AI 爬虫放行规则,是一组让 AI 相关抓取请求访问公开页面、同时限制敏感路径和异常流量的技术配置,通常覆盖 robots.txt、User-Agent 识别、WAF 例外、CDN Bot 策略和访问日志复核。
它与传统 SEO 爬虫放行不同。百度、搜狗等搜索爬虫通常有较成熟的站长平台和验证路径,而部分 AI 相关爬虫的公开文档并不完整。因此,官网不能只写一段 robots.txt 就结束,还要验证请求是否真的拿到 200 状态码、是否被安全策略挑战、是否进入 AI 回答的引用链路。
官网为什么“写了 Allow”仍可能不被 AI 读到?
robots.txt 只表达抓取许可,不等于网络层已经放行。很多官网真正的问题出在 CDN、WAF、人机验证、JS 挑战、地域策略、登录墙或源站限速,AI 爬虫在这些环节会收到 403、429 或空 HTML。
RFC 9309 的 Robots Exclusion Protocol定义了 robots.txt 的基础匹配方式;Google 关于创建 robots.txt 的文档也说明了 user-agent、allow、disallow 等规则的作用边界。结论很明确:robots 是声明层,WAF/CDN 是执行层,日志与 AI 结果才是验收层。
常见误区有四类:
User-agent: * Disallow: /仍保留在生产环境;- WAF 把无 Cookie、无 JS 执行能力的请求判定为恶意机器人;
- CDN 开启 Bot 管理后,只默认放行传统搜索引擎;
- 内容主体依赖前端渲染,爬虫拿到的是空壳页面。
可复制的 robots.txt 最小放行模板
安全的放行原则是:公开内容允许抓取,业务后台和低价值路径继续屏蔽。不要为了“让 AI 看见”而开放登录页、账户中心、内部 API、站内搜索结果和带参数的重复页面。
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /account/
Disallow: /api/
Disallow: /search
Disallow: /*?*
User-agent: Bytespider
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /account/
Disallow: /api/
User-agent: Baiduspider
Allow: /
Disallow: /admin/
Disallow: /login/
Disallow: /account/
Disallow: /api/
Sitemap: https://www.example.com/sitemap.xml
这里没有把所有国产 AI 平台都写成确定 UA,是因为部分平台并未持续公开可核验的专用爬虫标识。比如 DeepSeekBot 在第三方目录中常被提及,但公开可验证资料有限,企业更应结合日志、响应码和引用结果判断。若要进一步拆分,可参考站内的国产 ai bot 白名单配置指南和DeepSeekBot User-agent 写法清单。
WAF 与 CDN 应该怎么放行?
WAF/CDN 放行应采用“最小例外”:只对可信 UA、公共路径、GET/HEAD 方法和合理频率降低误拦,不要直接跳过全部安全规则。这样既能提升 AI 可读性,也能避免被伪造 UA 的爬虫滥用。
可用这张表做配置口径:
| 层级 | 建议放行 | 仍需拦截 | 验收指标 |
|---|---|---|---|
| robots.txt | 官网、博客、文档、案例、产品页 | 后台、登录、账户、API、搜索页 | 文件 200,可被直接访问 |
| UA 识别 | 命中特定 AI/搜索爬虫 token | 空 UA、伪装浏览器的高频请求 | 日志中 UA 可检索 |
| WAF | 公共路径的 GET/HEAD | POST、撞库、扫描、异常参数 | 403 明显下降 |
| CDN | 静态资源、HTML 正常回源 | 地域异常、突发高频、缓存穿透 | 200/304 占比提升 |
| 内容层 | 服务端可见正文、结构化标题 | 纯 JS 空壳、登录后内容 | curl 可读到核心文案 |
使用 Cloudflare 的网站可关注官方的Verified Bots 与 WAF 放行说明,并结合站内的Cloudflare WAF 例外规则配置收窄范围。阿里云 WAF 用户可参考阿里云合法爬虫放行功能,但要注意其默认覆盖更多是传统搜索爬虫,不等于所有 AI 爬虫都会被自动识别。

一套四层验收矩阵:别只看配置,要看结果
判断官网能不能被 AI 引擎读到,应按“声明、访问、内容、引用”四层验收。只要其中一层断掉,AI 搜索可见性就可能失真:robots 允许但 WAF 拦截,或页面 200 但正文为空,都不能算真正可读。
MaxAEO 在做品牌 AI 基线诊断时,常把官网可读性拆成四个问题:
- 声明层:
/robots.txt是否 200?是否误写全站禁止? - 访问层:目标页面对爬虫 UA 是否返回 200/304,而非 403/429/503?
- 内容层:首屏 HTML 是否包含品牌名、产品定义、适用场景、价格或方案入口?
- 引用层:AI 回答是否引用官网、自有博客、文档或权威第三方页面?
一个脱敏复盘示例:某 B2B SaaS 官网公开页均可由浏览器访问,但在边缘安全日志中,文档目录对无 Cookie 请求返回 403。修复前,10 个采购类问题里 AI 更多引用软件下载站和旧新闻;修复 robots、WAF 路径例外和文档页服务端正文后,再用同一问题矩阵复测,官网相关引用开始出现,负面旧描述减少。这个案例的关键不是“放行某个 UA”,而是把抓取、内容和复测放进同一闭环。
哪些页面最值得优先开放给 AI 读取?
优先放行能回答采购问题的页面:产品页、功能页、价格页、行业方案、客户案例、帮助文档、对比页和关于我们。AI 引擎在生成推荐时,更需要稳定、结构化、可引用的事实来源,而不是营销口号。
建议按优先级处理:
- 品牌事实页:公司名称、产品定位、服务范围、联系方式;
- 购买决策页:价格、套餐、适用对象、部署方式、安全说明;
- 场景解决方案页:按行业、角色、任务说明具体价值;
- 证据页:案例、教程、白皮书、更新日志、FAQ;
- 机器可读辅助文件:sitemap、结构化数据、可选的 llms.txt。
如果已上线 llms.txt,不要把它当成 robots 的替代品。可用llms.txt 文件检测清单确认文件存在、可访问、内容不冲突;再用AI 引用来源分析方法判断这些页面是否真的进入 AI 信源。
放行后如何持续监测是否生效?
放行后的验证至少持续 7–14 天,并使用同一批问题、同一批平台、同一统计口径复测。单日 AI 回答有波动,不能因为一次出现或消失就判断规则成功或失败。
建议记录三组指标:
- 抓取侧:AI/搜索相关 UA 的请求次数、状态码、路径、带宽、WAF 命中事件;
- 内容侧:核心页面是否被成功返回,正文是否出现在 HTML 中;
- AI 结果侧:品牌提及率、推荐位次、情绪倾向、引用来源、自有域名占比。
MaxAEO 国内版覆盖豆包、DeepSeek、腾讯元宝、Kimi、通义千问、文心一言等 9 个中国大陆 AI 平台,支持监测品牌提及率、排序、情绪评价与引用来源。企业可先用 MaxAEO 免费诊断建立基线,再结合日志排查确认“爬虫已访问”与“AI 已引用”之间的差距。

常见问题
只要放行 Bytespider,就等于豆包一定会引用官网吗?
不等于。Bytespider 常被视为字节系抓取的重要线索,但 AI 是否引用还取决于页面质量、权威性、内容结构、更新频率和模型检索策略。放行只是进入候选信源的前置条件。
DeepSeekBot 要不要单独写进 robots.txt?
可以写,但不应只依赖这一个动作。由于公开可验证资料有限,更稳妥的做法是保留公共内容对 User-agent: * 可抓取,同时用日志观察疑似 DeepSeek 相关请求是否被 WAF/CDN 拦截。
WAF 白名单能不能只按 User-Agent 放行?
不建议。UA 很容易伪造,单独按 UA 放行会扩大风险。更安全的规则应叠加路径、方法、频率、响应码和必要的 Bot 验证能力,只对公开内容降级拦截。
AI 爬虫需要访问 CSS 和 JS 吗?
至少不要阻断影响页面理解的关键资源。但更重要的是,核心正文应在服务端 HTML 中可见。若产品信息完全依赖前端接口加载,许多爬虫可能读不到完整内容。
放行后多久能看到 AI 搜索变化?
没有固定时间。建议先观察 7–14 天日志,再用同一问题矩阵复测 AI 回答。若抓取正常但仍不引用,应继续补足内容结构、权威信源和第三方可验证资料。
