作者:maxaeo.cn|发布日期:2026-09-04|更新日期:2026-09-04
AI 机器人 UA 白名单指把可信 AI 爬虫或 AI 助手的 User-Agent 纳入允许策略,让它们能读取公开内容,同时避免把伪装爬虫、扫描器和高风险路径一并放进来。正确做法不是“看到 UA 就放行”,而是 robots 声明、UA 匹配、来源校验、路径限权、日志复测 一起做。

什么是 AI 机器人 UA 白名单?
AI 机器人 UA 白名单是面向 AI 搜索、答案引擎、模型训练或实时浏览机器人的访问控制清单,通常基于 User-Agent、路径、IP/ASN、请求频率和安全动作组合配置。
User-Agent 只是请求头中的一段文本,能说明“对方自称是谁”,但不能证明对方真的来自该平台。Google 的 robots.txt 文档也明确把 user-agent 作为规则匹配字段,用于指定自动客户端适用的抓取规则;但 robots.txt 本身是声明性协议,不是防火墙。可参考 Google Search Central 的 robots.txt 创建说明。
因此,白名单应分两层理解:
| 层级 | 作用 | 不能解决的问题 |
|---|---|---|
| robots.txt | 告诉合规爬虫哪些路径可抓 | 不能阻止恶意请求 |
| WAF/CDN 规则 | 决定请求是否被挑战、跳过或拦截 | 不能仅靠 UA 判断真伪 |
| 服务器日志 | 验证是否真实访问成功 | 不能自动提升 AI 引用 |
| 内容结构 | 让可访问页面更容易被理解 | 不能替代权限控制 |
哪些 AI 机器人值得放行?
值得放行的是与你的增长目标相关、能带来搜索发现、答案引用或用户触达的机器人;训练型爬虫、实时检索型爬虫和 AI 助手型访问应分开管理。
常见场景可以这样划分:
- AI 搜索/答案引用型:更接近“用户正在问问题,AI 需要引用网页”。这类通常优先放行公开内容页、文档页、产品页。
- AI 助手实时访问型:用户在 AI 工具中要求打开某网页或总结页面。适合放行官网、帮助中心、价格说明等可公开页面。
- 训练数据型:用于模型训练或数据集构建。是否放行取决于版权、内容资产策略和法务判断。
- 未知或伪装型:只带相似 UA,没有可验证来源或行为异常。应先观察,不应直接跳过 WAF。
Cloudflare 的 AI Crawl Control 文档维护了部分已识别 AI bot 类型和参考信息,做规则前可核对 Cloudflare AI Crawl Control 的 bot reference。但即便来源是官方目录,也建议把“允许访问哪些路径”写清楚,而不是全站放开。
安全放行的四层框架:声明、识别、限权、复测
安全的 AI bot 白名单不是一条 allow 规则,而是一套最小权限流程:先声明抓取意图,再识别 UA,再限制路径和安全动作,最后用日志确认是否 200 返回。
MaxAEO 在做 AI 搜索可见性诊断时,会把“能不能被抓到”和“能不能被 AI 正确引用”拆开看。前者看访问链路,后者看内容信源与 AI 回答。对技术团队来说,可采用下面的四层框架:
第 1 层:robots.txt 先表达访问边界
robots.txt 适合写“哪些机器人可以读哪些公开路径”。如果你的目标是让 AI 能理解官网核心信息,至少应保证这些路径不被误拦:
User-agent: *
Allow: /robots.txt
Allow: /llms.txt
Allow: /blog/
Allow: /docs/
Allow: /pricing/
Disallow: /admin/
Disallow: /api/
Disallow: /checkout/
Disallow: /account/
如果你已经在建设 AI 可读内容索引,可以配合 llms.txt 目录索引设计 把品牌介绍、产品能力、定价、案例、文档等页面组织成清晰入口。注意:robots 允许不代表 CDN 一定放行,后面仍要检查 WAF。
第 2 层:UA 匹配只作为初筛
UA 匹配适合筛出“疑似 AI 爬虫”,但不适合作为唯一信任依据。攻击者可以把请求头伪装成任何热门 AI crawler。
日志中建议至少记录这些字段:
| 字段 | 用途 |
|---|---|
user_agent |
判断是否命中 AI bot 特征 |
ip |
后续做来源验证、频率分析 |
host |
区分主站、文档站、子域名 |
path |
判断是否访问了敏感路径 |
status |
看是否被 403、429、503、challenge |
cf_ray 或边缘请求 ID |
排查 Cloudflare/WAF 命中规则 |
referer |
辅助识别异常流量 |
timestamp |
判断抓取频率与复测窗口 |
如果还没有建立识别清单,可先按 ai 爬虫 ua 识别方法 从日志中抽取 UA,再把“明确需要放行”和“需要观察”的对象分开。
第 3 层:Cloudflare 或 WAF 只做最小跳过
Cloudflare 爬虫白名单不建议写成“UA 包含 bot 就跳过所有安全检查”。更安全的方式是按路径、UA、请求方法和安全动作分层。
一个更稳妥的思路是:
- 仅允许
GET、HEAD。 - 仅放行公开内容路径,如
/blog/、/docs/、/pricing/、/llms.txt。 - 对登录、支付、搜索、表单、API 路径继续拦截或挑战。
- 对命中 UA 但访问异常路径的请求保留 WAF 检查。
- 对频率过高的请求保留 rate limit。
如果你使用 Cloudflare,可参考 Cloudflare 爬虫白名单怎么设置 和 Cloudflare WAF 例外规则配置 设计跳过范围。关键不是“放行越多越好”,而是让 AI 能读到公开内容,同时不把后台、接口和交易路径暴露出去。

第 4 层:用同口径日志复测
复测要看同一个 UA、同一批路径、同一时间窗口下的状态变化。只看 robots 文件是否写对,无法判断真实抓取链路是否通畅。
建议用一张 7 日复测表:
| 指标 | 合格口径 |
|---|---|
| robots 可访问 | /robots.txt 返回 200 |
| llms 可访问 | /llms.txt 返回 200 或明确不存在 |
| 公开内容页 | 样本 URL 返回 200,非 challenge |
| 敏感路径 | /admin/、/api/ 等仍为 403/401/404 |
| AI UA 命中 | 日志能看到目标 UA 访问 |
| 异常频率 | 单 IP 高频请求被限速 |
| 引用变化 | 后续在 AI 回答中观察是否出现新来源 |
MaxAEO 提供 AI 搜索可见性监测与优化平台,可覆盖豆包、DeepSeek、腾讯元宝、通义千问、文心一言、Kimi 等国产 AI 平台的提及率、排序、情绪评价与引用来源监测。技术放行完成后,仍需要持续观察 AI 是否真的读取并引用了目标页面。
一份可直接采用的放行决策表
最小权限决策表比单纯白名单更可靠:先判断机器人类型,再决定允许路径、WAF 动作和复测指标,避免把“可读内容”与“全站开放”混为一谈。
| 请求类型 | 处理建议 | 原因 |
|---|---|---|
| 官方可识别 AI 搜索爬虫访问内容页 | 允许或跳过部分 WAF | 有助于公开内容被发现 |
| AI 助手访问单个公开 URL | 允许 GET/HEAD | 可能来自用户即时查询 |
| 训练型爬虫访问全站 | 按版权策略决定 | 不一定带来直接引用 |
任意 AI UA 访问 /api/ |
拦截或挑战 | 与内容抓取无关 |
| 任意 AI UA 访问登录/支付路径 | 拦截 | 高风险路径 |
| UA 自称 AI bot 但频率异常 | 限速并观察 | 可能是伪装或采集 |
| 无 UA 或随机 UA 扫描 | 按普通恶意流量处理 | 不应纳入白名单 |
这个表的独特价值在于把“AI 可见性收益”和“站点安全成本”同时纳入判断。很多团队只在 robots 里写 Allow,却忽略了 CDN、WAF、缓存和路径权限,结果 AI 仍然拿不到页面,或者把不该放的路径也放开。
官网、文档站、博客和报价页应如何分场景放行?
不同页面的放行边界不同:官网与博客适合较宽松,文档站要避开私有接口,报价页可开放公开版本,账户、支付和客户数据页面应始终排除。
可按站点类型配置:
- 官网首页与产品页:允许可信 AI bot 访问,确保品牌名、产品类别、核心能力清晰。
- 博客与知识库:优先开放,因为它们常成为 AI 回答中的解释型信源。
- 文档站:开放公开文档,排除 API token、私有部署、内部调试路径。
- 报价页:开放公开套餐说明,但避免让已废弃价格页被索引和引用。
- 登录后台与客户数据页:不进入任何 AI bot 白名单。
若站点页面类型较多,可参考 Cloudflare 分场景白名单配置 把规则按官网、文档、博客和报价页拆开,而不是只写一条全局 UA 规则。
放行后为什么 AI 仍然不引用?
AI 能访问页面,不代表一定引用页面。引用还受内容结构、信源权威性、页面更新、主题相关性、外部引用和模型检索策略影响。
常见原因包括:
- 页面可访问但信息不完整:AI 读到页面,却找不到清晰的品牌定义、产品能力或适用场景。
- 内容过度营销化:缺少可摘录的事实、对比、步骤和结构化信息。
- 老页面覆盖新页面:搜索和 AI 系统可能仍引用旧标题、旧价格、旧功能描述。
- 竞品信源更强:AI 在回答品类问题时,更倾向引用第三方榜单、评测、文档或高权重媒体。
- 没有持续复测:一次放行不能证明后续模型回答会变化。
MaxAEO 的引用溯源功能可按域名统计 AI 引用次数,并下钻至具体 URL 与对应 AI 回答。对于 SaaS 与工具类品牌,更建议把 UA 白名单看作 GEO/AEO 基础设施的一部分,而不是单独的技术任务。

常见问题
AI 机器人 UA 白名单和 robots.txt 是一回事吗?
不是。robots.txt 是抓取声明,告诉合规机器人哪些路径可访问;UA 白名单通常在 CDN、WAF 或服务器层执行,决定请求是否被放行、挑战或拦截。两者需要同时检查。
只靠 User-Agent 放行安全吗?
不安全。User-Agent 可以被伪造,只能作为初筛条件。更稳妥的做法是结合路径、请求方法、频率、来源验证和日志复测,并对敏感路径始终保持拦截。
Cloudflare 中应该跳过哪些安全检查?
通常只建议对可信 AI bot 访问公开内容页时跳过会造成误拦的托管挑战或特定 WAF 规则,不建议跳过所有防护。登录、支付、API、搜索和表单路径应继续受保护。
放行 AI 爬虫能保证品牌被 AI 推荐吗?
不能保证。放行只能解决“能否访问”的问题。品牌是否被推荐,还取决于页面内容是否清晰、是否有可引用来源、竞品信源强弱,以及 AI 平台的检索和生成策略。
如何判断配置已经生效?
至少检查三件事:目标 UA 访问公开页面返回 200;敏感路径仍然被拦截;日志中能看到同一批 URL 在配置前后的状态变化。如果目标是 AI 搜索可见性,还要继续监测提及率、推荐位次和引用来源。
